Advertisement

python数据爬取---从文本中提取特征

阅读量:

1、寻找目标网站并分析结构

本次我们将爬取名为‘百思不得其姐’的内涵段子网站。

目标网址:http://www.budejie.com/text/1

网站结构方面,每一页默认展示20条段子,若需翻页,则第2页的链接为http://www.budejie.com/text/2,由此可推测该站点通过在链接末尾添加数字的方式实现分页功能。基于此特征,我们可采用循环结构来获取所有页面的数据。目标页面范围设定为第1至第10页。

页面结构分析:通过鼠标右键选择“检查”功能,可以发现段子内容被存储在一个

2、编写爬虫进行内容爬取

复制代码
 #导入request库用来请求http

    
 import requests
    
 #导入BeautifulSoup用来对html进行

全部评论 (0)

还没有任何评论哟~