一文掌握Python爬虫XPath语法(节点选取)

公司动态

产品资讯

行业资讯

轻云服务器升级CN2线路有什么优点

目录

一、问题描述

1.什么是XPath？

二、解决方案

1.XPath语法
2.lxml库
3.实际案例

三、结语

本文转自微信公众号："算法与编程之美"

一、问题描述

1.什么是XPath？

xpath是一门在XML和HTML文档中查找信息的语言，可用来在XML和HTML文档中对元素和属性进行遍历，XPath 通过使用路径表达式来选取 XML 文档中的节点或者节点集。这些路径表达式和在常规的电脑文件系统中看到的表达式非常相似。

二、解决方案

1.XPath语法

想要学好xpath，首先要搞明白html文档中的节点。

<div>
  <ul>
 <li class="item-0"><a href="link1.html" rel="external nofollow" >first item</a></li>
 <li class="item-1"><a href="link2.html" rel="external nofollow" >second item</a></li>
 <li class="item-inactive"><a href="link3.html" rel="external nofollow" >third item</a></li>
 <li class="item-1"><a href="link4.html" rel="external nofollow" >fourth item</a></li>
 <li class="item-0"><a href="link5.html" rel="external nofollow" >fifth item</a> # 注意，此处缺少一个 </li> 闭合标签
</ul>
  </div>

以上是在网上随便找的一段html的文本，可以观察得到，div的标签下是ul标签，而ul标签下是li标签，于是发现html的标签是一级一级如树状的。Xpath正是通过这样的方式去寻找。以生活中举例，要确定一个人的位置，首先确定他在中国，然后确定他在某个省份，哪座城市，那个小区，最后找到他。

表达式	描述
Nodename	选取此节点的所有子节点 bookstore 选取bookstore下所有的子节点
/	如果是在最前面，代表从根节点选取。否则选择某节点下的某个节点 /bookstore 选取根元素下所有的bookstore节点
//	从全局节点中选择节点，随便在哪个位置 //book 从全局节点中找到所有的book节点
@	选取某个节点的属性 //book[@price] 选择所有拥有price属性的book节点
.	当前节点
Text()	获取标签中的文本

同级标签可以用li[1] ,li[2] ,li[3]的方式获取

2.lxml库

简单介绍一下lxml库，接下来会用到它

lxml是一个HTML/XML的解析器，主要的功能是如何解析和提取HTML/XML 数据。

lxml和正则一样，也是用C实现的，是一款高性能的PythonHTML/XML解析器，可以利用之前学习的XPath语法，来快速的定位特定元素以及节点信息。

3.实际案例

随便爬取一个网站，找到找到网站的html文本

如下图：

要找到title和href，仔细观察可以得到路径分别是//div[@id="resultList"]/div[@class="el"]/p/span/a/@title

//div[@id="resultList"]/div[@class="el"]/p/span/a/@href

运行如下：

三、结语

Xpath，是在爬虫中常见的提取数据的方式之一，相比于正则，它更加简单一些，便于操作，xpath的难点在于准确的确定数据所在的位置。

到此这篇关于一文掌握Python爬虫XPath语法的文章就介绍到这了,更多相关Python爬虫XPath语法内容请搜索本站以前的文章或继续浏览下面的相关文章希望大家以后多多支持本站！

版权声明：本站文章来源标注为YINGSOO的内容版权均为本站所有，欢迎引用、转载，请保持原文完整并注明来源及原文链接。禁止复制或仿造本网站，禁止在非www.yingsoo.com所属的服务器上建立镜像，否则将依法追究法律责任。本站部分内容来源于网友推荐、互联网收集整理而来，仅供学习参考，不代表本站立场，如有内容涉嫌侵权，请联系alex-e#qq.com处理。

相关文章

动态拨号：关键词排名下降是啥缘故，快速提高排名怎样做

排名优化：网站排名优化方法有什么，如何做有效果

老域名：怎样才算老域名，老域名建站有什么影响

内容优化：关键字排名要做哪些方面的优化，怎样做

技巧：网站转化率究竟是什么，有什么提升的技巧

一下吧：外贸站优化有哪些基本的做法和注意事项

概要：竞价推广费用大概要多少呢，竞价推广好不好

一下吧：SEO中site是什么意思，作用和应用是怎样的

邮箱：付费邮箱有哪些优势，付费邮箱挑选要考虑什么

集群是什么意思：集群是什么意思，都有哪些优势呢

服务器配置数据库配置服务器运维服务器安全
互联网资讯服务器公司 IDC数据中心
免费服务器香港服务器租用美国服务器租用

上一篇：

Python 自动化处理Excel和Word实现自动办公

下一篇：

教你在pycharm中使用tensorflow的方法

实时开通

自选配置、实时开通

免备案

全球线路精选！

全天候客户服务

7x24全年不间断在线

专属顾问服务

1对1客户咨询顾问

在线
客服

在线客服：7*24小时在线

客服
热线



400-630-3752
7*24小时客服服务热线

关注
微信

关注官方微信