python数据爬取---从文本中提取特征
发布时间
阅读量:
阅读量
1、寻找目标网站并分析结构
本次我们将爬取名为‘百思不得其姐’的内涵段子网站。
目标网址:http://www.budejie.com/text/1
网站结构方面,每一页默认展示20条段子,若需翻页,则第2页的链接为http://www.budejie.com/text/2,由此可推测该站点通过在链接末尾添加数字的方式实现分页功能。基于此特征,我们可采用循环结构来获取所有页面的数据。目标页面范围设定为第1至第10页。
页面结构分析:通过鼠标右键选择“检查”功能,可以发现段子内容被存储在一个


2、编写爬虫进行内容爬取
#导入request库用来请求http
import requests
#导入BeautifulSoup用来对html进行
全部评论 (0)
还没有任何评论哟~
