Advertisement

Python 爬虫基础:JSON requests Beautiful Soup lxml 爬取静态网页

阅读量:

概念

网络爬虫(spider),亦称网络数据采集器,是一种能够向网站或网络发出请求,获取相关资源并进行解析以提取有价值信息的软件程序。该程序通过模拟浏览器访问网站的行为,获取网站返回的HTML代码、JSON数据或⼆进制内容(如图片、视频)等信息,并将其下载至本地存储,随后从中筛选出所需的数据并加以保存以便后续使用。

步骤

  1. 发起请求

    1. 请求类型:GET、POST
    2. 请求地址
    3. 请求标识:User-Agent、Host、Cookies等
  2. 数据获取
    1. 回应状态码
    2. 回应头信息
    3. 回应内容:所需提取的数据

  3. 数据处理
    1. 正则匹配技术
    2. lxml解析库
    3. BeautifulSoup解析工具

  4. 数据保存
    1. 文本文件形式
    2. 数据库存储方式
    3. 二进制格式文件

安装常用包

requests库、bs4库以及lxml库

命令行执行

复制代码
    conda info -e	#查看所有环境
    
    pip list	#查看当前环境下面有哪些包
    
    conda install requests	#安装r

全部评论 (0)

还没有任何评论哟~