基於BeautifulSoup對Books to Scrape爬蟲
HW要求¶
目標網站:https://books.toscrape.com/
請擷取首頁每一本書的:
- 書名
- 價格
- 庫存狀態
- 星級評分
- 商品內頁網址
- 圖片網址
資料清理要求:
- 移除價格中的 £。
- 將價格轉成 float。
- 將英文星級轉成數字。
轉換規則:
然後,你需要先取得每一本書的內頁網址,再逐一進入商品頁補齊詳細資料。取得:
- 商品描述
- UPC
- 商品類型
- 未稅價格
- 含稅價格
- 稅額
- 庫存數量
- 評論數量
將相對網址轉成完整網址,儲存為Books to Scrape 書籍清單.csv。