Python Web Scraping Notes. 使用BeautifulSoup
发布时间
阅读量:
阅读量
Beautiful Soup应用与分析
- 一,总体介绍
- 二,解析工具
- 三,基础操作
- 四,节点筛选器
- 五,方式筛选器
- 六,CSS筛选器
一,概述
Python提供了一款用于解析HTML或XML格式文档的库,能够便捷地从网页中抓取所需信息。该工具可自动将输入的文档转换为Unicode编码格式,并将输出的文档编码为UTF-8标准。
二,解析器
| 解析器 | 使用方法 |
|---|---|
| Python标准库 | BeautifulSoup(markup,‘html.parser’) |
| lxml HTML 解析器 | BeautifulSoup(markup,‘lxml’) |
| lxml XML 解析器 | BeautifulSoup(markup,‘xml’) |
| html5lib | BeautifulSoup(markup,’html5lib‘) |
三,基本使用
①构建BeautifulSoup实例
②运用所生成实例的相关属性及方法对HTML代码进行解析
soup = BeautifulSoup(markup,parser)
参数:
第一项参数:需进行解析的目标对象,可为HTML格式的字符串或文件句柄
第二项参数:所采用的解析
全部评论 (0)
还没有任何评论哟~
