Advertisement

Python Web Scraping Notes. 使用BeautifulSoup

阅读量:

Beautiful Soup应用与分析

  • 一,总体介绍
    • 二,解析工具
    • 三,基础操作
    • 四,节点筛选器
    • 五,方式筛选器
    • 六,CSS筛选器

一,概述

Python提供了一款用于解析HTML或XML格式文档的库,能够便捷地从网页中抓取所需信息。该工具可自动将输入的文档转换为Unicode编码格式,并将输出的文档编码为UTF-8标准。

二,解析器

解析器 使用方法
Python标准库 BeautifulSoup(markup,‘html.parser’)
lxml HTML 解析器 BeautifulSoup(markup,‘lxml’)
lxml XML 解析器 BeautifulSoup(markup,‘xml’)
html5lib BeautifulSoup(markup,’html5lib‘)

三,基本使用

①构建BeautifulSoup实例
②运用所生成实例的相关属性及方法对HTML代码进行解析

复制代码
    soup = BeautifulSoup(markup,parser)
    
    
      
    

参数:
第一项参数:需进行解析的目标对象,可为HTML格式的字符串或文件句柄
第二项参数:所采用的解析

全部评论 (0)

还没有任何评论哟~