chinese直男口爆体育生外卖, 99久久er热在这里只有精品99, 又色又爽又黄18禁美女裸身无遮挡, gogogo高清免费观看日本电视,私密按摩师高清版在线,人妻视频毛茸茸,91论坛 兴趣闲谈,欧美 亚洲 精品 8区,国产精品久久久久精品免费

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

python解析庫的使用--XPath

python爬蟲知識分享 ? 來源:python爬蟲知識分享 ? 作者:python爬蟲知識分享 ? 2022-03-22 15:50 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

XPath(XML Path Language)是一門在XML文檔中查找信息的語言。

XPath 可用來在XML文檔中對元素和屬性進(jìn)行遍歷。

XPath 是 W3C XSLT 標(biāo)準(zhǔn)的主要元素,并且 XQueryXPointer 都構(gòu)建于 XPath 表達(dá)之上。

官方網(wǎng)址:http://lxml.de 官方文檔:http://lxml.de/api/index.html

注:XQuery 是用于 XML 數(shù)據(jù)查詢的語言(類似SQL查詢數(shù)據(jù)庫中的數(shù)據(jù))

注:XPointer 由統(tǒng)一資源定位地址(URL)中#號之后的描述組成,類似于HTML中的錨點(diǎn)鏈接

python中如何安裝使用XPath:

①: 安裝 lxml 庫。

②: from lxml import etree

③: Selector = etree.HTML(網(wǎng)頁源代碼)

④: Selector.xpath(xpath選取規(guī)則)

1. 準(zhǔn)備工作:

  • 要使用XPath首先要先安裝lxml庫:
pip install lxml

2. XPath選取節(jié)點(diǎn)規(guī)則

表達(dá)式 描述
nodename 選取此節(jié)點(diǎn)的所有子節(jié)點(diǎn)。
/ 從當(dāng)前節(jié)點(diǎn)選取直接子節(jié)點(diǎn)
// 從匹配選擇的當(dāng)前節(jié)點(diǎn)選擇所有子孫節(jié)點(diǎn),而不考慮它們的位置
. 選取當(dāng)前節(jié)點(diǎn)。
.. 選取當(dāng)前節(jié)點(diǎn)的父節(jié)點(diǎn)。
@ 選取屬性。
  • XPath 運(yùn)算符
運(yùn)算符 描述 實(shí)例 返回值
| 計(jì)算兩個節(jié)點(diǎn)集 //book | //cd 返回所有擁有 book 和 cd 元素的節(jié)點(diǎn)集
+ 加法 6 + 4 10
- 減法 6 - 4 2
* 乘法 6 * 4 24
div 除法 8 div 4 2
= 等于 price=9.80 如果 price 是 9.80,則返回 true。、\n 如果 price 是 9.90,則返回 false。
!= 不等于 price!=9.80 如果 price 是 9.90,則返回 true。\n 如果 price 是 9.80,則返回 false。
< 小于 price<9.80 如果 price 是 9.00,則返回 true。\n 如果 price 是 9.90,則返回 false。
<= 小于或等于 price<=9.80 如果 price 是 9.00,則返回 true。\n 如果 price 是 9.90,則返回 false。
> 大于 price>9.80 如果 price 是 9.90,則返回 true。\n如果 price 是 9.80,則返回 false。
>= 大于或等于 price>=9.80 如果 price 是 9.90,則返回 true。\n如果 price 是 9.70,則返回 false。
or price=9.80 or price=9.70 如果 price 是 9.80,則返回 true。\n如果 price 是 9.50,則返回 false。
and price>9.00 and price<9.90 如果 price 是 9.80,則返回 true。\n如果 price 是 8.50,則返回 false。
mod 計(jì)算除法的余數(shù) 5 mod 2 1

3. 解析案例:

  • 首先創(chuàng)建一個html文件:my.html 用于測試XPath的解析效果

我的常用鏈接

  • 使用XPath解析說明
# 導(dǎo)入模塊
from lxml import etree

# 讀取html文件信息(在真實(shí)代碼中是爬取的網(wǎng)頁信息)
f = open("./my.html",'r',encoding="utf-8")
content = f.read()
f.close()

# 解析HTML文檔,返回根節(jié)點(diǎn)對象
html = etree.HTML(content)
#print(html)  # 

# 獲取網(wǎng)頁中所有標(biāo)簽并遍歷輸出標(biāo)簽名
result = html.xpath("http://*")
for t in result:
    print(t.tag,end=" ")
#[html head title body h3 ul li a li a ... ... td]
print()

# 獲取節(jié)點(diǎn)
result = html.xpath("http://li") # 獲取所有l(wèi)i節(jié)點(diǎn)
result = html.xpath("http://li/a") # 獲取所有l(wèi)i節(jié)點(diǎn)下的所有直接a子節(jié)點(diǎn)
result = html.xpath("http://ul//a") # 效果同上(ul下所有子孫節(jié)點(diǎn))
result = html.xpath("http://a/..") #獲取所有a節(jié)點(diǎn)的父節(jié)點(diǎn)
print(result)

# 獲取屬性和文本內(nèi)容
result = html.xpath("http://li/a/@href") #獲取所有l(wèi)i下所有直接子a節(jié)點(diǎn)的href屬性值
result = html.xpath("http://li/a/text()") #獲取所有l(wèi)i下所有直接子a節(jié)點(diǎn)內(nèi)的文本內(nèi)容
print(result) #['百度', '京東', '搜狐', '新浪', '淘寶']

result = html.xpath("http://li/a[@class]/text()") #獲取所有l(wèi)i下所有直接含有class屬性子a節(jié)點(diǎn)內(nèi)的文本內(nèi)容
print(result) #['百度', '搜狐', '新浪']

#獲取所有l(wèi)i下所有直接含有class屬性值為aa的子a節(jié)點(diǎn)內(nèi)的文本內(nèi)容
result = html.xpath("http://li/a[@class='aa']/text()") 
print(result) #['搜狐', '新浪']

#獲取class屬性值中含有shop的li節(jié)點(diǎn)下所有直接a子節(jié)點(diǎn)內(nèi)的文本內(nèi)容
result = html.xpath("http://li[contains(@class,'shop')]/a/text()") 
print(result) #['搜狐', '新浪']


# 按序選擇
result = html.xpath("http://li[1]/a/text()") # 獲取每組li中的第一個li節(jié)點(diǎn)里面的a的文本
result = html.xpath("http://li[last()]/a/text()") # 獲取每組li中最后一個li節(jié)點(diǎn)里面的a的文本
result = html.xpath("http://li[position()<3]/a/text()") # 獲取每組li中前兩個li節(jié)點(diǎn)里面的a的文本
result = html.xpath("http://li[last()-2]/a/text()") # 獲取每組li中倒數(shù)第三個li節(jié)點(diǎn)里面的a的文本
print(result) 

print("--"*30)
# 節(jié)點(diǎn)軸選擇
result = html.xpath("http://li[1]/ancestor::*") # 獲取li的所有祖先節(jié)點(diǎn)
result = html.xpath("http://li[1]/ancestor::ul") # 獲取li的所有祖先中的ul節(jié)點(diǎn)
result = html.xpath("http://li[1]/a/attribute::*") # 獲取li中a節(jié)點(diǎn)的所有屬性值
result = html.xpath("http://li/child::a[@) #獲取li子節(jié)點(diǎn)中屬性href值的a節(jié)點(diǎn)
result = html.xpath("http://body/descendant::a") # 獲取body中的所有子孫節(jié)點(diǎn)a
print(result) 

result = html.xpath("http://li[3]") #獲取li中的第三個節(jié)點(diǎn)    
result = html.xpath("http://li[3]/following::li") #獲取第三個li節(jié)點(diǎn)之后所有l(wèi)i節(jié)點(diǎn)
result = html.xpath("http://li[3]/following-sibling::*") #獲取第三個li節(jié)點(diǎn)之后所有同級li節(jié)點(diǎn)
for v in result:
    print(v.find("a").text)
  • 解析案例
# 導(dǎo)入模塊
from lxml import etree

# 讀取html文件信息(在真實(shí)代碼中是爬取的網(wǎng)頁信息)
f = open("./my.html",'r')
content = f.read()
f.close()

# 解析HTML文檔,返回根節(jié)點(diǎn)對象
html = etree.HTML(content)

# 1. 獲取id屬性為hid的h3節(jié)點(diǎn)中的文本內(nèi)容
print(html.xpath("http://h3[@id='hid']/text()")) #['我的常用鏈接']


# 2. 獲取li中所有超級鏈接a的信息
result = html.xpath("http://li/a")
for t in result:
    # 通過xapth()二次解析結(jié)果
    #print(t.xpath("text()")[0], ':', t.xpath("@href")[0])

    # 效果同上,使用節(jié)點(diǎn)對象屬性方法解析
    print(t.text, ':', t.get("href"))

'''
#結(jié)果:
百度 : http://www.baidu.com
京東 : http://www.jd.com
搜狐 : http://www.sohu.com
新浪 : http://www.sina.com
淘寶 : http://www.taobao.com
'''

'''
HTML元素的屬性:
    tag:元素標(biāo)簽名
    text:標(biāo)簽中間的文本
HTML元素的方法:
    find()    查找一個匹配的元素
    findall() 查找所有匹配的元素    
    get(key, default=None) 獲取指定屬性值
    items()獲取元素屬性,作為序列返回
    keys()獲取屬性名稱列表
    value()將元素屬性值作為字符串序列
'''


審核編輯:湯梓紅
聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報投訴
  • 信息
    +關(guān)注

    關(guān)注

    0

    文章

    409

    瀏覽量

    36432
  • 數(shù)據(jù)
    +關(guān)注

    關(guān)注

    8

    文章

    7349

    瀏覽量

    95045
  • python
    +關(guān)注

    關(guān)注

    58

    文章

    4888

    瀏覽量

    90322
收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評論

    相關(guān)推薦
    熱點(diǎn)推薦

    RK3576 單板機(jī) C/Python/MQTT 應(yīng)用開發(fā)手冊(二)

    本文為創(chuàng)龍科技RK3576 單板機(jī)應(yīng)用開發(fā)指南,包含開發(fā)環(huán)境配置、GDB 調(diào)試、外設(shè)控制(LED/CAN/ 串口)、Python 開發(fā)及 MQTT 通信案例。提供完整編譯命令、代碼解析與實(shí)測
    的頭像 發(fā)表于 04-21 10:43 ?94次閱讀
    RK3576 單板機(jī) C/<b class='flag-5'>Python</b>/MQTT 應(yīng)用開發(fā)手冊(二)

    RK3576 單板機(jī) C/Python/MQTT 應(yīng)用開發(fā)手冊(一)

    本文為創(chuàng)龍科技RK3576 單板機(jī)應(yīng)用開發(fā)指南,包含開發(fā)環(huán)境配置、GDB 調(diào)試、外設(shè)控制(LED/CAN/ 串口)、Python 開發(fā)及 MQTT 通信案例。提供完整編譯命令、代碼解析與實(shí)測
    的頭像 發(fā)表于 04-20 13:55 ?311次閱讀
    RK3576 單板機(jī) C/<b class='flag-5'>Python</b>/MQTT 應(yīng)用開發(fā)手冊(一)

    [VirtualLab] 使用Python運(yùn)行VirtualLab Fusion光學(xué)仿真

    摘要 VirtualLab Fusion允許Python外部訪問其建模技術(shù)、求解器和結(jié)果。這個用例介紹了一種使用路徑變量和Visual Studio代碼將Python連接到VirtualLab
    發(fā)表于 03-31 09:39

    如何使用 Python 將 I2C LCD 與 VIsionFive 一起使用?

    以使用新的 VisionFive.gpio 。 讓我們連接 LCD 來監(jiān)控事物 By Hamzah。 如何使用 Python 將 I2C LCD 與 VIsionFive 一起使用:I2c LCD 是當(dāng)今非常
    發(fā)表于 03-30 06:52

    強(qiáng)強(qiáng)聯(lián)合:imc FAMOS內(nèi)嵌Python接口,提高分析效率!

    德國知名車廠工程師首選將Python和imcFAMOS結(jié)合起來用于分析測試和測量數(shù)據(jù)——這是否有意義?事實(shí)上這非常有意義。Python和imcFAMOS可以很好地相互補(bǔ)充。Python作為一種編程
    的頭像 發(fā)表于 03-18 09:05 ?497次閱讀
    強(qiáng)強(qiáng)聯(lián)合:imc FAMOS內(nèi)嵌<b class='flag-5'>Python</b>接口,提高分析效率!

    如何在 Vision Five 2 上安裝 python ?

    這可能是一個完全愚蠢的問題,但我如何在 Vision Five 2 上安裝 python 。 使用該命令后,它給了我這個錯誤。 默認(rèn)為用戶安裝,因?yàn)槠胀ㄕ军c(diǎn)包不可寫 錯誤:找不到滿足要求
    發(fā)表于 03-06 07:51

    無法去除 Python VisionFive.i2c 的終端輸出?

    燒的官方最新八月份的 debian 12 的系統(tǒng)。 根據(jù)這個案例安裝好了 python 環(huán)境和 VisionFive 。 執(zhí)行下面這條代碼: import VisionFive.i2c
    發(fā)表于 02-25 06:13

    1688 商品詳情 API 調(diào)用與數(shù)據(jù)解析 Python 實(shí)戰(zhàn)

    你想要的是 1688 商品詳情 API 的 Python 調(diào)用與數(shù)據(jù)解析實(shí)戰(zhàn)方案,核心是完成 API 憑證配置、接口請求(含簽名)、響應(yīng)數(shù)據(jù)解析、異常處理 的全流程落地,我會提供可直接運(yùn)行的代碼,并
    的頭像 發(fā)表于 02-10 11:23 ?401次閱讀

    cJSON是什么?

    cJSON是什么?cJSON是一個輕量級的json解析。使用起來非常簡單,整個非常地簡潔,核心功能的實(shí)現(xiàn)都在cJSON.c文件,非常適合閱讀源代碼來學(xué)習(xí)C語言。最近讀完這個
    發(fā)表于 01-29 07:13

    Python調(diào)用API教程

    兩個不同系統(tǒng)之間的信息交互。在這篇文章中,我們將詳細(xì)介紹Python調(diào)用API的方法和技巧。 一、用Requests發(fā)送HTTP請求 使用Python調(diào)用API的第一步是發(fā)送HTTP請求,通常
    的頭像 發(fā)表于 11-03 09:15 ?1198次閱讀

    HTTP開發(fā)必備:核心與httpplus擴(kuò)展應(yīng)用示例全攻略

    HTTP開發(fā)的必備參考!本文匯總核心基礎(chǔ)操作與httpplus擴(kuò)展高級特性,通過示例解析,讓你快速上手各類HTTP開發(fā)需求。
    的頭像 發(fā)表于 09-20 15:19 ?3331次閱讀
    HTTP開發(fā)必備:核心<b class='flag-5'>庫</b>與httpplus擴(kuò)展<b class='flag-5'>庫</b>應(yīng)用示例全攻略

    電磁環(huán)境數(shù)據(jù)管理系統(tǒng)平臺軟件解析

    電磁環(huán)境數(shù)據(jù)管理平臺軟件解析(精簡版)
    的頭像 發(fā)表于 09-15 21:00 ?487次閱讀
    電磁環(huán)境數(shù)據(jù)<b class='flag-5'>庫</b>管理系統(tǒng)平臺軟件<b class='flag-5'>解析</b>

    termux如何搭建python游戲

    termux如何搭建python游戲 Termux搭建Python游戲開發(fā)環(huán)境的完整指南 一、Termux基礎(chǔ)環(huán)境準(zhǔn)備 Termux是一款無需root即可在安卓設(shè)備上運(yùn)行的Linux終端
    發(fā)表于 08-29 07:06

    數(shù)據(jù)數(shù)據(jù)恢復(fù)—服務(wù)器異常斷電導(dǎo)致Oracle數(shù)據(jù)故障的數(shù)據(jù)恢復(fù)案例

    備份,僅有一些斷斷續(xù)續(xù)的歸檔日志。 Oracle數(shù)據(jù)恢復(fù)流程: 1、檢測數(shù)據(jù)故障情況; 2、嘗試掛起并修復(fù)數(shù)據(jù); 3、解析數(shù)據(jù)
    的頭像 發(fā)表于 07-24 11:12 ?855次閱讀
    數(shù)據(jù)<b class='flag-5'>庫</b>數(shù)據(jù)恢復(fù)—服務(wù)器異常斷電導(dǎo)致Oracle數(shù)據(jù)<b class='flag-5'>庫</b>故障的數(shù)據(jù)恢復(fù)案例

    linux虛擬環(huán)境中調(diào)用Linux 版matlab編譯的python時出錯

    matlab代碼編譯為CAO_pythonpython,其中cp_Main_python.m為入口文件,編譯后生成的文件有mccExcludedFiles.log、setup.py
    發(fā)表于 07-18 10:40