日本免费高清视频-国产福利视频导航-黄色在线播放国产-天天操天天操天天操天天操|www.shdianci.com

學無先后,達者為師

網站首頁 編程語言 正文

Python操作lxml庫之基礎使用篇_python

作者:醉蕤 ? 更新時間: 2023-01-29 編程語言

一、lxml庫概述

1、lxml庫介紹

lxml是XML和HTML的解析器,其主要功能是解析和提取XML和HTML中的數據;lxml和正則一樣,也是用C語言實現的,是一款高性能的python HTML、XML解析器,也可以利用XPath語法,來定位特定的元素及節點信息。

2、lxml庫特點

HTML是超文本標記語言,主要用于顯示數據,他的焦點是數據的外觀

XML是可擴展標記語言,主要用于傳輸和存儲數據,他的焦點是數據的內容

3、lxml庫的安裝

windows系統下,在cmd命令提示框中,輸入如下命令

pip install lxml

在cmd命令行驗證是否安裝成功。若引入模塊,不返回錯誤則說明安裝成功。?

二、基本使用

1、lxml.etree

在爬蟲代碼采集過程中,通過etree.HTML直接將字符串實例轉化為element對象。

import requests
from lxml import etree
 
res = requests.get("http://www.jsons.cn/zt/")
 
html = res.text
 
root_element = etree.HTML(html)
 
print(root_element)
print(root_element.tag)

2、解析HTML網頁

#解析HTML字符串
from lxml import etree
text = '''
<html><body>
    <div class="key">
        <div class="name">無羨</div>
        <div class="age">20</div>
        <div class="address">四川</div>
    </div>
</body></html>
'''
# 開始初始化
html = etree.HTML(text)  # 這里需要傳入一個html形式的字符串
print(html)
print(type)
# 將字符串序列化為html字符串
result = etree.tostring(html).decode('utf-8')
print(result)
print(type(result))

3、讀取并解析HTML文件

from lxml import etree
 
# 將html文件進行讀取
html = etree.parse('1.html')
 
# 將html內容序列化
result = etree.tostring(html).decode('utf-8')
print(result)
print(type(result))
html = etree.HTML(result)  # 這里需要傳入一個html形式的字符串
print(html)
print(type)

三、lxml使用流程

1、?導入模塊

from lxml import etree

2、創建解析對象

調用 etree 模塊的 HTML() 方法來創建 HTML 解析對象。

parse_html = etree.HTML(html)

HTML() 方法能夠將 HTML 標簽字符串解析為 HTML 文件,該方法可以自動修正 HTML 文本。

from lxml import etree
html_str = '''
<div>
    <ul>
         <li class="item1"><a href="link1.html">Python</a></li>
         <li class="item2"><a href="link2.html">Java</a></li>
         <li class="site1"><a href="c.biancheng.net">C語言中文網</a>
         <li class="site2"><a href="www.baidu.com">百度</a></li>
         <li class="site3"><a href="www.jd.com">京東</a></li>
     </ul>
</div>
'''
html = etree.HTML(html_str)
 
result = etree.tostring(html)
print(result.decode('utf-8'))

四、lxml庫數據提取

1、提取所有a標簽內的文本信息

from lxml import etree
# 創建解析對象
parse_html=etree.HTML(html)
# 書寫xpath表達式,提取文本最終使用text()
xpath_bds='//a/text()'
# 提取文本數據,以列表形式輸出
r_list=parse_html.xpath(xpath_bds)
# 打印數據列表
print(r_list)

2、獲取所有href的屬性值

from lxml import etree
# 創建解析對象
parse_html=etree.HTML(html)
# 書寫xpath表達式,提取文本最終使用text()
xpath_bds='//a/@href'
# 提取文本數據,以列表形式輸出
r_list=parse_html.xpath(xpath_bds)
# 打印數據列表
print(r_list)

3、不匹配href=" www.biancheng.net/priduct"

from lxml import etree
# 創建解析對象
parse_html=etree.HTML(html)
# 書寫xpath表達式,提取文本最終使用text()
xpath_bds='//a/@href'
# 提取文本數據,以列表形式輸出
xpath_bds='//ul[@id="sitename"]/li/a/@href'
# 打印數據列表
print(r_list)

總結

原文鏈接:https://blog.csdn.net/m0_63794226/article/details/126360128

欄目分類
最近更新