Advertisement

数据解析聚焦爬虫:爬取网页指定内容

阅读量:

数据解析(聚焦爬虫:爬取页面中指定的页面内容)

1.编码流程设计与实施

  1. 设定网络地址
  2. 触发访问操作
  3. 接收返回信息
  4. 对信息进行处理分析
  5. 实现数据的长期保存

2.数据解析与分类方法

  1. 正则表达式
  2. BeautifulSoup库
  3. XPath(重点)

3.数据解析原理概述

所有被解析的局部文本信息均会被保存在便签之间或与便签相关联的属性之中

  1. 对特定标签进行定位操作
  2. 从标签本身或其对应属性中提取所存储的数据(即解析过程)

4.常用正则表达式回顾

单字符
(.): 除换行符之外的所有字符
([]):[aoe],[a-w] 匹配集合中的任意一个字符
(\d): 数字,等价于[0-9]
(\D): 非数字字符
(\w): 包括数字、字母、下划线及中文字符
(\W): 不属于\w的字符
(\s): 所有空白字符,例如空格、制表符、换页符等,等同于[\f\n\r\t\v]
(\S): 非空白字符
数量修饰
_:表示可以出现任意次数,包括零次或以上
+: 至少出现一次,即不少于一次
?: 表示可有可无,即零次或一次
{m}: 固定出现m次,如hello

全部评论 (0)

还没有任何评论哟~