Crawling Top 250 movies from DouBan
发布时间
阅读量:
阅读量
豆瓣电影TOP250数据爬取
【
目标爬取的网页地址:https://movie.douban.com/top250
本次数据采集的对象为250部影片的基础资料,包括影片的序号、片名、导演信息、上映年份以及用户评分。完成数据获取后,将所有影片的相关信息整理并存储于一个csv格式的文件中。

将页面滚动至最下方后,可以发现总共包含10页内容,因此需要对单个页面进行爬取操作,并重复执行该过程10次。每次操作所采用的爬取方式保持一致,唯一不同之处在于网址中某一参数的值。

1.使用requests库爬取页面源代码
该操作步骤较为简易,无需进行账户验证,也无需对请求头信息进行重新配置。
> 1. def getPage(url):
>
> 2. try:
全部评论 (0)
还没有任何评论哟~
