跳轉到

基於BeautifulSoup對Books to Scrape爬蟲

HW要求

目標網站:https://books.toscrape.com/

請擷取首頁每一本書的:

  • 書名
  • 價格
  • 庫存狀態
  • 星級評分
  • 商品內頁網址
  • 圖片網址

資料清理要求:

  • 移除價格中的 £。
  • 將價格轉成 float。
  • 將英文星級轉成數字。

轉換規則:

rating_map = {
    "One": 1,
    "Two": 2,
    "Three": 3,
    "Four": 4,
    "Five": 5
}

然後,你需要先取得每一本書的內頁網址,再逐一進入商品頁補齊詳細資料。取得:

  • 商品描述
  • UPC
  • 商品類型
  • 未稅價格
  • 含稅價格
  • 稅額
  • 庫存數量
  • 評論數量

將相對網址轉成完整網址,儲存為Books to Scrape 書籍清單.csv