Advertisement

Crawling Top 250 movies from DouBan

阅读量:

豆瓣电影TOP250数据爬取

目标爬取的网页地址:https://movie.douban.com/top250

本次数据采集的对象为250部影片的基础资料,包括影片的序号、片名、导演信息、上映年份以及用户评分。完成数据获取后,将所有影片的相关信息整理并存储于一个csv格式的文件中。

将页面滚动至最下方后,可以发现总共包含10页内容,因此需要对单个页面进行爬取操作,并重复执行该过程10次。每次操作所采用的爬取方式保持一致,唯一不同之处在于网址中某一参数的值。

1.使用requests库爬取页面源代码

该操作步骤较为简易,无需进行账户验证,也无需对请求头信息进行重新配置。

复制代码
>       1. def getPage(url):

>  
>       2.     try:

全部评论 (0)

还没有任何评论哟~