Python爬蟲解析器BeautifulSoup4怎么使用

發布時間：2022-07-13 10:55:18 來源：億速云閱讀：158 作者：iii 欄目：編程語言

這篇文章主要介紹“Python爬蟲解析器BeautifulSoup4怎么使用”的相關知識，小編通過實際案例向大家展示操作過程，操作方法簡單快捷，實用性強，希望這篇“Python爬蟲解析器BeautifulSoup4怎么使用”文章能幫助大家解決問題。

一、BeautifulSoup4庫介紹

1. 介紹

Beautiful Soup 是一個可以從HTML或XML文件中提取數據的Python庫.它能夠通過你喜歡的轉換器實現慣用的文檔導航,查找,修改文檔的方式.Beautiful Soup會幫你節省數小時甚至數天的工作時間。

BeautifulSoup4將網頁轉換為一顆DOM樹：
Python爬蟲解析器BeautifulSoup4怎么使用

2. 下載模塊

1. window電腦點擊win鍵+ R，輸入：cmd

Python爬蟲解析器BeautifulSoup4怎么使用

2. 安裝beautifulsoup4，輸入對應的pip命令：pip install beautifulsoup4 ，我已經安裝過了出現版本就安裝成功了

Python爬蟲解析器BeautifulSoup4怎么使用
3. 導包

form bs4 import BeautifulSoup

3. 解析庫

BeautifulSoup在解析時實際上依賴解析器，它除了支持Python標準庫中的HTML解析器外，還支持一些第三方解析器(比如lxml)：

解析器	使用方法	優勢	劣勢
Python標準庫	`BeautifulSoup(html,’html.parser’)`	Python的內置標準庫、執行速度適中、文檔容錯能力強	Python 2.7.3及Python3.2.2之前的版本文檔容錯能力差
lxml HTML解析庫	`BeautifulSoup(html,’lxml’)`	速度快、文檔容錯能力強	需要安裝C語言庫
lxml XML解析庫	`BeautifulSoup(html,‘xml'`	速度快、唯一支持XML的解析器	需要安裝C語言庫
htm5lib解析庫	`BeautifulSoup(html,’htm5llib’)`	最好的容錯性、以瀏覽器的方式解析文檔、生成HTMLS格式的文檔	速度慢、不依賴外部擴展

對于我們來說，我們最常使用的解析器是lxml HTML解析器，其次是html5lib.

二、上手操作

1. 基礎操作

1. 讀取HTML字符串：

from bs4 import BeautifulSoup

html = '''
<p class="panel">
    <p class="panel-heading">
        <h5>Hello</h5>
    </p>
    <p class="panel_body">
        <ul class="list" id="list-1" name="element">
            <li class="element">Foo</li>
            <li class="element">Bar</li>
            <li class="element">Jay</li>
        </ul>
        <ul class="list list-small" id="list-2">
            <li class="element">Foo</li>
                <a href="https://www.baidu.com">百度官網</a>
            <li class="element">Bar</li>
        </ul>
    </p>
</p> 
'''# 創建對象soup = BeautifulSoup(html, 'lxml')

2. 讀取HTML文件：

from bs4 import BeautifulSoup

soup = BeautifulSoup(open('index.html'),'lxml')

3. 基本方法

from bs4 import BeautifulSoup

html = '''
<p class="panel">
    <p class="panel-heading">
        <h5>Hello</h5>
    </p>
    <p class="panel_body">
        <ul class="list" id="list-1" name="element">
            <li class="element">Foo</li>
            <li class="element">Bar</li>
            <li class="element">Jay</li>
        </ul>
        <ul class="list list-small" id="list-2">
            <li class="element">Foo</li>
                <a href="https://www.baidu.com">百度官網</a>
            <li class="element">Bar</li>
        </ul>
    </p>
</p> 
'''# 創建對象soup = BeautifulSoup(html, 'lxml')# 縮進格式print(soup.prettify())# 獲取title標簽的所有內容print(soup.title)# 獲取title標簽的名稱print(soup.title.name)# 獲取title標簽的文本內容print(soup.title.string)# 獲取head標簽的所有內容print(soup.head)# 獲取第一個p標簽中的所有內容print(soup.p)# 獲取第一個p標簽的id的值print(soup.p["id"])# 獲取第一個a標簽中的所有內容print(soup.a)# 獲取所有的a標簽中的所有內容print(soup.find_all("a"))# 獲取id="u1"print(soup.find(id="u1"))# 獲取所有的a標簽，并遍歷打印a標簽中的href的值for item in soup.find_all("a"):
    print(item.get("href"))# 獲取所有的a標簽，并遍歷打印a標簽的文本值for item in soup.find_all("a"):
    print(item.get_text())

2. 對象種類

Beautiful Soup將復雜HTML文檔轉換成一個復雜的樹形結構,每個節點都是Python對象,所有對象可以歸納為4種: Tag , NavigableString , BeautifulSoup , Comment .

（1）Tag：Tag通俗點講就是HTML中的一個個標簽，例如：

soup = BeautifulSoup('<b class="boldest">Extremely bold</b>','lxml')
tag = soup.b
print(tag)
print(type(tag))

輸出結果：

<b class="boldest">Extremely bold</b>
<class 'bs4.element.Tag'>

Tag有很多方法和屬性,在遍歷文檔樹和搜索文檔樹中有詳細解釋.現在介紹一下tag中最重要的屬性: name和attributes：

name屬性：

print(tag.name)
# 輸出結果：b
# 如果改變了tag的name,那將影響所有通過當前Beautiful Soup對象生成的HTML文檔:
tag.name = "b1"
print(tag)
# 輸出結果：<b1 class="boldest">Extremely bold</b1>

Attributes屬性：

# 取clas屬性
print(tag['class'])

# 直接”點”取屬性, 比如: .attrs :
print(tag.attrs)

tag 的屬性可以被添加、修改和刪除：

# 添加 id 屬性
tag['id'] = 1

# 修改 class 屬性
tag['class'] = 'tl1'

# 刪除 class 屬性
del tag['class']

（2）NavigableString：用.string獲取標簽內部的文字：

print(soup.b.string)print(type(soup.b.string))

（3）BeautifulSoup：表示的是一個文檔的內容，可以獲取它的類型，名稱，以及屬性：

print(type(soup.name))
# <type 'unicode'>

print(soup.name)
# [document]

print(soup.attrs)
# 文檔本身的屬性為空

（4）Comment：是一個特殊類型的 NavigableString 對象，其輸出的內容不包括注釋符號。

print(soup.b)

print(soup.b.string)

print(type(soup.b.string))

3. 搜索文檔樹

1.find_all(name, attrs, recursive, text, **kwargs)

（1）name 參數：name 參數可以查找所有名字為 name 的tag,字符串對象會被自動忽略掉

匹配字符串：查找與字符串完整匹配的內容,用于查找文檔中所有的<a>標簽
```
a_list = soup.find_all("a")print(a_list)
```
匹配正則表達式：如果傳入正則表達式作為參數,Beautiful Soup會通過正則表達式的 match() 來匹配內容
```
# 返回所有表示<body>和<b>標簽for tag in soup.find_all(re.compile("^b")):
    print(tag.name)
```
匹配列表：如果傳入列表參數,Beautiful Soup會將與列表中任一元素匹配的內容返回
```
# 返回所有所有<p>標簽和<a>標簽:soup.find_all(["p", "a"])
```

（2）kwargs參數

soup.find_all(id='link2')

（3）text參數：通過 text 參數可以搜搜文檔中的字符串內容，與 name 參數的可選值一樣, text 參數接受字符串 , 正則表達式 , 列表

# 匹配字符串
soup.find_all(text="a")

# 匹配正則
soup.find_all(text=re.compile("^b"))

# 匹配列表
soup.find_all(text=["p", "a"])

4. css選擇器

我們在使用BeautifulSoup解析庫時，經常會結合CSS選擇器來提取數據。

注意：以下講解CSS選擇器只選擇標簽，至于獲取屬性值和文本內容我們后面再講。

1. 根據標簽名查找：比如寫一個 li 就會選擇所有li 標簽, 不過我們一般不用，因為我們都是精確到標簽再提取數據的

from bs4 import BeautifulSoup

html = '''
<p class="panel">
    <p class="panel-heading">
        <h5>Hello</h5>
    </p>
    <p class="panel_body">
        <ul class="list" id="list-1" name="element">
            <li class="element">Foo</li>
            <li class="element">Bar</li>
            <li class="element">Jay</li>
        </ul>
        <ul class="list list-small" id="list-2">
            <li class="element">Foo</li>
                <a href="https://www.baidu.com">百度官網</a>
            <li class="element">Bar</li>
        </ul>
    </p>
</p> 
'''# 創建對象soup = BeautifulSoup(html, 'lxml')# 1. 根據標簽名查找：查找li標簽print(soup.select("li"))

輸出結果：

[<li class="element">Foo</li>, <li class="element">Bar</li>, <li class="element">Jay</li>, <li class="element">Foo</li>, <li class="element">Bar</li>]

2. 根據類名class查找。.1ine, 即一個點加line，這個表達式選的是class= "line "的所有標簽，".”代表class

print(soup.select(".panel_body"))

輸出結果：

</ul>
<ul class="list list-small" id="list-2">
<li class="element">Foo</li>
<li class="element">Bar</li>
</ul>
</div>]

3. 根據id查找。#box,即一個#和box表示選取id-”box "的所有標簽，“#”代表id

print(soup.select("#list-1"))

輸出結果：

[<ul class="list" id="list-1" name="element">
<li class="element">Foo</li>
<li class="element">Bar</li>
<li class="element">Jay</li>
</ul>]

4. 根據屬性的名字查找。class屬性和id屬性較為特殊，故單獨拿出來定義一個". "和“”來表示他們。

比如：input[ name=“username”]這個表達式查找name= "username "的標簽，此處注意和xpath語法的區別

print(soup.select('ul[ name="element"]'))

輸出結果：

[<ul class="list" id="list-1" name="element">
<li class="element">Foo</li>
<li class="element">Bar</li>
<li class="element">Jay</li>
</ul>]

5. 標簽+類名或id的形式。

# 查找id為list-1的ul標簽
print(soup.select('ul#list-1'))
print("-"*20)
# 查找class為list的ul標簽
print(soup.select('ul.list'))

輸出結果：

[<ul class="list" id="list-1" name="element">
<li class="element">Foo</li>
<li class="element">Bar</li>
<li class="element">Jay</li>
</ul>]
--------------------
[<ul class="list" id="list-1" name="element">
<li class="element">Foo</li>
<li class="element">Bar</li>
<li class="element">Jay</li>
</ul>, <ul class="list list-small" id="list-2">
<li class="element">Foo</li>
<li class="element">Bar</li>
</ul>]

6. 查找直接子元素

# 查找id="list-1"的標簽下的直接子標簽liprint(soup.select('#list-1>li'))

輸出結果：

[<li class="element">Foo</li>, <li class="element">Bar</li>, <li class="element">Jay</li>]

7. 查找子孫標簽

# .panel_body和li之間是一個空格，這個表達式查找id=”.panel_body”的標簽下的子或孫標簽liprint(soup.select('.panel_body li'))

輸出結果：

[<li class="element">Foo</li>, <li class="element">Bar</li>, <li class="element">Jay</li>, <li class="element">Foo</li>, <li class="element">Bar</li>]

8. 取某個標簽的屬性

# 1. 先取到<p class="panel_body">p = soup.select(".panel_body")[0]# 2. 再去下面的a標簽下的href屬性print(p.select('a')[0]["href"])

輸出結果：

https://www.baidu.com

9. 獲取文本內容有四種方式：

(a) string：獲得某個標簽下的文本內容，強調-一個標簽，不含嵌我。返回-個字符串

# 1. 先取到<p class="panel_body">p = soup.select(".panel_body")[0]# 2. 再去下面的a標簽下print(p.select('a')[0].string)

輸出結果：

百度官網

(b) strings：獲得某個標簽下的所有文本內容，可以嵌套。返回-一個生成器，可用list(生成器)轉換為列表

print(p.strings)print(list(p.strings))

輸出結果：

<generator object Tag._all_strings at 0x000001AA58E525F0>['\n', '\n', 'Foo', '\n', 'Bar', '\n', 'Jay', '\n', '\n', '\n', 'Foo', '\n', '百度官網', '\n', 'Bar', '\n', '\n']

（c）stripped.strings：跟(b)差不多，只不過它會去掉每個字符串頭部和尾部的空格和換行符

print(p.stripped_strings)print(list(p.stripped_strings))

輸出結果：

<generator object PageElement.stripped_strings at 0x000001F9995525F0>['Foo', 'Bar', 'Jay', 'Foo', '百度官網', 'Bar']

(d) get.text():獲取所有字符串，含嵌套. 不過會把所有字符串拼接為一個，然后返回
注意2:
前3個都是屬性，不加括號;最后一個是函數，加括號。

print(p.get_text())

輸出結果：

Foo
Bar
Jay


Foo
百度官網
Bar

關于“Python爬蟲解析器BeautifulSoup4怎么使用”的內容就介紹到這里了，感謝大家的閱讀。如果想了解更多行業相關的知識，可以關注億速云行業資訊頻道，小編每天都會為大家更新不同的知識點。

向AI問一下細節

中文字幕av专区_日韩电影在线播放_精品国产精品久久一区免费式_av在线免费观看网站

Python爬蟲解析器BeautifulSoup4怎么使用

一、BeautifulSoup4庫介紹

1. 介紹

2. 下載模塊

3. 解析庫

二、上手操作

1. 基礎操作

2. 對象種類

3. 搜索文檔樹

4. css選擇器

猜你喜歡

中文字幕av专区_日韩电影在线播放_精品国产精品久久一区免费式_av在线免费观看网站

Python爬蟲解析器BeautifulSoup4怎么使用

一、BeautifulSoup4庫介紹

1. 介紹

2. 下載模塊

3. 解析庫

二、上手操作

1. 基礎操作

2. 對象種類

3. 搜索文檔樹

4. css選擇器

猜你喜歡

最新資訊

相關推薦

相關標簽