網(wǎng)站首頁(yè) 編程語言 正文
一、lxml庫(kù)概述
1、lxml庫(kù)介紹
lxml是XML和HTML的解析器,其主要功能是解析和提取XML和HTML中的數(shù)據(jù);lxml和正則一樣,也是用C語言實(shí)現(xiàn)的,是一款高性能的python HTML、XML解析器,也可以利用XPath語法,來定位特定的元素及節(jié)點(diǎn)信息。
2、lxml庫(kù)特點(diǎn)
HTML是超文本標(biāo)記語言,主要用于顯示數(shù)據(jù),他的焦點(diǎn)是數(shù)據(jù)的外觀
XML是可擴(kuò)展標(biāo)記語言,主要用于傳輸和存儲(chǔ)數(shù)據(jù),他的焦點(diǎn)是數(shù)據(jù)的內(nèi)容
3、lxml庫(kù)的安裝
windows系統(tǒng)下,在cmd命令提示框中,輸入如下命令
pip install lxml
在cmd命令行驗(yàn)證是否安裝成功。若引入模塊,不返回錯(cuò)誤則說明安裝成功。?
二、基本使用
1、lxml.etree
在爬蟲代碼采集過程中,通過etree.HTML直接將字符串實(shí)例轉(zhuǎn)化為element對(duì)象。
import requests
from lxml import etree
res = requests.get("http://www.jsons.cn/zt/")
html = res.text
root_element = etree.HTML(html)
print(root_element)
print(root_element.tag)
2、解析HTML網(wǎng)頁(yè)
#解析HTML字符串
from lxml import etree
text = '''
<html><body>
<div class="key">
<div class="name">無羨</div>
<div class="age">20</div>
<div class="address">四川</div>
</div>
</body></html>
'''
# 開始初始化
html = etree.HTML(text) # 這里需要傳入一個(gè)html形式的字符串
print(html)
print(type)
# 將字符串序列化為html字符串
result = etree.tostring(html).decode('utf-8')
print(result)
print(type(result))
3、讀取并解析HTML文件
from lxml import etree
# 將html文件進(jìn)行讀取
html = etree.parse('1.html')
# 將html內(nèi)容序列化
result = etree.tostring(html).decode('utf-8')
print(result)
print(type(result))
html = etree.HTML(result) # 這里需要傳入一個(gè)html形式的字符串
print(html)
print(type)
三、lxml使用流程
1、?導(dǎo)入模塊
from lxml import etree
2、創(chuàng)建解析對(duì)象
調(diào)用 etree 模塊的 HTML() 方法來創(chuàng)建 HTML 解析對(duì)象。
parse_html = etree.HTML(html)
HTML() 方法能夠?qū)?HTML 標(biāo)簽字符串解析為 HTML 文件,該方法可以自動(dòng)修正 HTML 文本。
from lxml import etree
html_str = '''
<div>
<ul>
<li class="item1"><a href="link1.html">Python</a></li>
<li class="item2"><a href="link2.html">Java</a></li>
<li class="site1"><a href="c.biancheng.net">C語言中文網(wǎng)</a>
<li class="site2"><a href="www.baidu.com">百度</a></li>
<li class="site3"><a href="www.jd.com">京東</a></li>
</ul>
</div>
'''
html = etree.HTML(html_str)
result = etree.tostring(html)
print(result.decode('utf-8'))
四、lxml庫(kù)數(shù)據(jù)提取
1、提取所有a標(biāo)簽內(nèi)的文本信息
from lxml import etree
# 創(chuàng)建解析對(duì)象
parse_html=etree.HTML(html)
# 書寫xpath表達(dá)式,提取文本最終使用text()
xpath_bds='//a/text()'
# 提取文本數(shù)據(jù),以列表形式輸出
r_list=parse_html.xpath(xpath_bds)
# 打印數(shù)據(jù)列表
print(r_list)
2、獲取所有href的屬性值
from lxml import etree
# 創(chuàng)建解析對(duì)象
parse_html=etree.HTML(html)
# 書寫xpath表達(dá)式,提取文本最終使用text()
xpath_bds='//a/@href'
# 提取文本數(shù)據(jù),以列表形式輸出
r_list=parse_html.xpath(xpath_bds)
# 打印數(shù)據(jù)列表
print(r_list)
3、不匹配href=" www.biancheng.net/priduct"
from lxml import etree
# 創(chuàng)建解析對(duì)象
parse_html=etree.HTML(html)
# 書寫xpath表達(dá)式,提取文本最終使用text()
xpath_bds='//a/@href'
# 提取文本數(shù)據(jù),以列表形式輸出
xpath_bds='//ul[@id="sitename"]/li/a/@href'
# 打印數(shù)據(jù)列表
print(r_list)
總結(jié)
原文鏈接:https://blog.csdn.net/m0_63794226/article/details/126360128
相關(guān)推薦
- 2022-05-20 python繪制餅圖的方法詳解_python
- 2022-07-03 C語言由淺入深了解變量的應(yīng)用_C 語言
- 2022-03-26 android獲取及監(jiān)聽手機(jī)網(wǎng)絡(luò)狀態(tài)_Android
- 2022-08-23 C++深入探究友元使用_C 語言
- 2021-11-13 Gateway網(wǎng)關(guān)工作原理及使用方法_其它綜合
- 2022-11-10 Flutter?WillPopScope攔截返回事件原理示例詳解_Android
- 2022-06-30 Redis三種常用的緩存讀寫策略步驟詳解_Redis
- 2022-12-08 C#?如何調(diào)用C++?dll?string類型返回_C#教程
- 最近更新
-
- window11 系統(tǒng)安裝 yarn
- 超詳細(xì)win安裝深度學(xué)習(xí)環(huán)境2025年最新版(
- Linux 中運(yùn)行的top命令 怎么退出?
- MySQL 中decimal 的用法? 存儲(chǔ)小
- get 、set 、toString 方法的使
- @Resource和 @Autowired注解
- Java基礎(chǔ)操作-- 運(yùn)算符,流程控制 Flo
- 1. Int 和Integer 的區(qū)別,Jav
- spring @retryable不生效的一種
- Spring Security之認(rèn)證信息的處理
- Spring Security之認(rèn)證過濾器
- Spring Security概述快速入門
- Spring Security之配置體系
- 【SpringBoot】SpringCache
- Spring Security之基于方法配置權(quán)
- redisson分布式鎖中waittime的設(shè)
- maven:解決release錯(cuò)誤:Artif
- restTemplate使用總結(jié)
- Spring Security之安全異常處理
- MybatisPlus優(yōu)雅實(shí)現(xiàn)加密?
- Spring ioc容器與Bean的生命周期。
- 【探索SpringCloud】服務(wù)發(fā)現(xiàn)-Nac
- Spring Security之基于HttpR
- Redis 底層數(shù)據(jù)結(jié)構(gòu)-簡(jiǎn)單動(dòng)態(tài)字符串(SD
- arthas操作spring被代理目標(biāo)對(duì)象命令
- Spring中的單例模式應(yīng)用詳解
- 聊聊消息隊(duì)列,發(fā)送消息的4種方式
- bootspring第三方資源配置管理
- GIT同步修改后的遠(yuǎn)程分支