怎么用scrapy框架構建python爬蟲

發布時間：2020-11-23 09:58:49 來源：億速云閱讀：132 作者：小新欄目：編程語言

這篇文章主要介紹了怎么用scrapy框架構建python爬蟲，具有一定借鑒價值，需要的朋友可以參考下。希望大家閱讀完這篇文章后大有收獲。下面讓小編帶著大家一起了解一下。

制作爬蟲，總體來說分為兩步：先爬再取。

也就是說，首先你要獲取整個網頁的所有內容，然后再取出其中對你有用的部分。

要建立一個Spider，你必須用scrapy.spider.BaseSpider創建一個子類，并確定三個強制的屬性：

創建douban_spider.py文件，保存在douban\spiders目錄下。并導入我們需用的模塊

怎么用scrapy框架構建python爬蟲

編寫主要模塊：

怎么用scrapy框架構建python爬蟲

然后運行一下，

怎么用scrapy框架構建python爬蟲

會看到有403錯誤，是因為我們爬取的時候沒加頭部導致的：

怎么用scrapy框架構建python爬蟲

我們來偽裝一下，在settings.py里加上USER_AGENT：

USER_AGENT = 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_8_3) AppleWebKit/536.5 
(KHTML, like Gecko) Chrome/19.0.1084.54 Safari/536.5'

再次運行，即可看到正確結果。

感謝你能夠認真閱讀完這篇文章，希望小編分享怎么用scrapy框架構建python爬蟲內容對大家有幫助，同時也希望大家多多支持億速云，關注億速云行業資訊頻道，遇到問題就找億速云，詳細的解決方法等著你來學習!

向AI問一下細節

中文字幕av专区_日韩电影在线播放_精品国产精品久久一区免费式_av在线免费观看网站