Advertisement

大数据采集入门, 网络爬虫技术, Beautiful Soup应用

阅读量:

BeautifulSoup应用

Beautiful Soup为用户提供了若干简洁且具备Python风格的函数,用于实现对文档树的导航、搜索及修改等操作。作为一种实用工具集,它能够将文档解析后提取用户所需的信息,由于其操作简便,仅需少量代码即可构建完整应用程序。该工具通过分析网页的结构与属性等特征来完成解析任务。借助此工具,我们无需再编写复杂的正则表达式,只需通过几条简短语句即可实现对网页中特定元素的提取。Beautiful Soup是Python语言中用于解析HTML或XML文档的库,能够帮助用户高效地从网页内容中获取所需数据。
该库可自动将输入的文档转换为Unicode编码格式,并将输出结果自动转换为UTF-8编码格式。
【使用步骤

复制代码
    #导入beautifulsoup4库
    pip install beautifulsoup4
    
    
      
      
    

② 构建BeautifulSoup实例

复制代码
    #方法一、直接通过字符串的形式创建
    #使用python标准库的HTML解析器
    soup=bs(html.read(),"html.parser")#html.parser是解析器,也可是lxml
    print(soup.prettify()) ----

全部评论 (0)

还没有任何评论哟~