Advertisement

我用Python爬取了中国校花网,并发现了其中的共同特征

阅读量:

众所周知,在爬虫技术中,当获取到网页的响应内容后,最核心的问题便是如何从结构复杂的网页中精准地提取所需数据。

在Python语言中,用于从网页中提取数据的库种类繁多,常见的解析工具包括以下几种:

BeautifulSoup这一库具有简单的API接口,但其解析效率较低,因此并不建议使用。

lxml是一个由C语言开发的XML解析库(libxm2),具备较高的解析速度,但其API设计较为复杂。

Scrapy则结合了上述两种工具的优势,并构建了自身独特的数据提取机制,该机制被称为Selector选择器。该选择器基于lxml库进行开发,并对API进行了简化。用户首先可以利用XPath或CSS选择器定位目标数据,随后完成数据提取操作。

Scrapy选择器是建立在lxml库之上的,这使得两者在处理速度与解析精确度方面表现出高度相似的特性。

Selector选择器应用解析

接下来,我们将通过 Scrapy Shell 以及 Scrapy 文档服务器中的一个示例页面(url=http://doc.scrapy.org/en/latest/_static/selectors-sample1.html)),来掌握选择器的基础使用方式:

构造选择器

Scrapy selector 可通过文字(Text)、二进制(content)或 TextResponse 对象进行构建。

全部评论 (0)

还没有任何评论哟~