Advertisement

python数据---简单页面

阅读量:

1、准备Requests和User Agent

在Python语言中支持网络爬虫功能的库有多种工具,在众多选项中最为便捷易学的是requests模块(也称作请求模块),该模块通常用于发送HTTP请求。建议先下载完成后安装到指定路径下以避免潜在问题

通常将User Agent译为客户端代理程序,在服务器端模拟浏览器访问目标网站;为了使网络爬虫以普通用户的视角访问目标网站服务器;如何获取自身的User Agent信息,则可以通过在百度搜索UA查询来实现

2、确定一个目标网站并分析其结构

我们计划以官方政府网站为中心进行数据采集

政策专栏的链接是:http://www.gov.cn/zhengce/index.htm,此网页列出近10条最新政策标题;

官方发布的重要政策信息库的位置是:http://www.gov.cn/zhengce/zuixin.htm。该网站收录了最新的60项重要政策信息。

点击指定政策名称并访问其详细信息页面,《国务院关于促进乡村产业振兴的意见》提供了相关指导。

3、爬取目标页面并保存为本地文件

复制代码
 #导入http请求库requests

    
 import requests
    
 #指定我们的user agent
    
 user_agent = 'Mozilla/5.0 (W

全部评论 (0)

还没有任何评论哟~