中文字幕av专区_日韩电影在线播放_精品国产精品久久一区免费式_av在线免费观看网站

溫馨提示×

溫馨提示×

您好,登錄后才能下訂單哦!

密碼登錄×
登錄注冊×
其他方式登錄
點擊 登錄注冊 即表示同意《億速云用戶服務條款》

Python爬蟲怎么獲取網頁上的鏈接

發布時間:2020-08-25 10:08:18 來源:億速云 閱讀:350 作者:Leah 欄目:編程語言

這期內容當中小編將會給大家帶來有關Python爬蟲怎么獲取網頁上的鏈接,文章內容豐富且以專業的角度為大家分析和敘述,閱讀完這篇文章希望大家可以有所收獲。

Beautiful Soup是python的一個庫,最主要的功能是從網頁抓取數據。利用Beautiful Soup可以對網頁進行解析,提取所有的超鏈接。

Beautiful Soup提供一些簡單的、python式的函數用來處理導航、搜索、修改分析樹等功能。它是一個工具箱,通過解析文檔為用戶提供需要抓取的數據,因為簡單,所以不需要多少代碼就可以寫出一個完整的應用程序。

Beautiful Soup自動將輸入文檔轉換為Unicode編碼,輸出文檔轉換為utf-8編碼。你不需要考慮編碼方式,除非文檔沒有指定一個編碼方式,這時,Beautiful Soup就不能自動識別編碼方式了。然后,你僅僅需要說明一下原始編碼方式就可以了。

Beautiful Soup已成為和lxml、html6lib一樣出色的python解釋器,為用戶靈活地提供不同的解析策略或強勁的速度。

BeautifulSoup支持Python標準庫中的HTML解析器,還支持一些第三方的解析器,如果我們不安裝它,則 Python 會使用 Python默認的解析器,lxml 解析器更加強大,速度更快,推薦使用lxml 解析器。

本文實例講述了python使用BeautifulSoup分頁網頁中超鏈接的方法。分享給大家供大家參考。具體如下:

python通過BeautifulSoup分析網頁中的超鏈接

from BeautifulSoup import BeautifulSoup
import urllib2
import re
url = urllib2.urlopen("http://www.bitsCN.com")
content = url.read()
soup = BeautifulSoup(content)
for a in soup.findAll('a',href=True):
  if re.findall('sharejs', a['href']):
    print "Found the URL:", a['href']

上述就是小編為大家分享的Python爬蟲怎么獲取網頁上的鏈接了,如果剛好有類似的疑惑,不妨參照上述分析進行理解。如果想知道更多相關知識,歡迎關注億速云行業資訊頻道。

向AI問一下細節

免責聲明:本站發布的內容(圖片、視頻和文字)以原創、轉載和分享為主,文章觀點不代表本網站立場,如果涉及侵權請聯系站長郵箱:is@yisu.com進行舉報,并提供相關證據,一經查實,將立刻刪除涉嫌侵權內容。

AI

广昌县| 清水河县| 竹北市| 景泰县| 嵩明县| 鄂伦春自治旗| 杭锦旗| 元氏县| 上高县| 财经| 兴义市| 黄冈市| 文水县| 象州县| 姚安县| 安丘市| 饶阳县| 瑞昌市| 容城县| 邹城市| 乌鲁木齐市| 高要市| 宜兰市| 灵丘县| 蛟河市| 唐河县| 三河市| 察雅县| 鄂托克前旗| 宁阳县| 福建省| 福鼎市| 资溪县| 汪清县| 正镶白旗| 瓦房店市| 牡丹江市| 云霄县| 杨浦区| 上杭县| 肥乡县|