爬虫(一)BS4框架
发布时间
阅读量:
阅读量
本人观看了北京理工大学嵩天老师的公开课程,并做了相应的学习笔记与实践总结。
图中附有该课程下载资料的截图。
感谢嵩天老师。
关键点在于网页内容提取实际上是通过解析HTML标签来实现信息抽取的过程。在使用BeautifulSoup库时,默认情况下该库会自动识别并提取所有匹配标记及其子标记的内容。具体来说,在BeautifulSoup库中可以通过 soup.find_all('p') 或者 soup.find('p').parent 来获取所需的信息。
逻辑过程:标签树→标签或者标签集合→标签内容
一、BeautifulSoup库入门
1、理解
该工具旨在实现对定向网络的网页数据抓取与解析功能。其中包含一个核心组件BS类(Bootstrap),它继承自Tag类。该组件提供了将HTML文档映射为Python对象的功能。通过指定标签名称即可访问其包含的具体标签对象(如像‘.a’或‘.body’这样的标签),若存在多个相同类型的标签,则只返回第一个符合条件的结果;要获取所有匹配结果,则需调用后续提供的find_all方法。
2、Tag基本方法
自指方式和遍历策略是两种主要的分类。
具体来说有以下四种自指方式:
- 类型别名
- 静态引用
- 静态成员函数
- 静态局部变量

还没有任何评论哟~
