1. 爬蟲基本概念
• 網頁的種類
• HTML結構
• HTML標籤與屬性
• 熟悉HTML各類標籤
• JSON文件
• XML文件
• 何謂爬蟲
• 爬蟲的資料形式
• 為什麼需要網路爬蟲
• 爬蟲所需相關技術
• 爬蟲步驟總覽
2. 擷取網路資料
• HTTP Header
• Chrome開發人員工具
• Request Method
• Http Request
• Http Request Content
• Http認證請求
• Requests錯誤狀況
3. 爬取靜態網頁
• 爬蟲第二步驟
• BeautifulSoup介紹
• BeautifulSoup常用物件
• 搜尋html網頁
4. 淺談正規表達式
• 什麼是正規表達式
• 字元集
• 比較字元
• python正規表達式
• 使用正規表達式搜尋網頁
5. CSS Selector
• 什麼是DOM Tree
• 基本設定方式
• 選擇器的注意事項
• 全選擇器
• 類別選擇器
• id選擇器
• 多重選擇器
• 子選擇器
• 相鄰兄弟選擇器
• 直屬選擇器
• 同層選擇器
• 屬性選擇器
• 虛擬選擇器
• Selector Gadget介紹
• Beautiful Soup使用CSS Selector
6. HTML 走訪
•
基本子走訪
•
子(向下)走訪
•
父(向上)走訪
•
兄弟(左右)走訪
•
走訪前一個、下一個元素
7. 實戰練習一
•
圖片存取
•
實戰練習一
•
實戰練習二
8. JSON 資料擷取
•
如何使用python解析JSON物件
•
Chrome輔助JSON外掛
•
擷取JSON資料
9. XML資料擷取
•
何謂XML
•
何謂XPATH
•
Request XML Data
•
使用開發者工具觀看XML Data
•
XPATH
•
使用XPATH抓取XML資料
•
使用XPATH抓取HTML資料
10. 實戰練習二
•
實戰練習一
•
實戰練習二
11. Selenium
•
為什麼需要Selenium?
•
Selenium簡介
•
安裝Selenium
•
Selenium基礎
•
Selenium例外方法
•
Selenium互動方法