Advertisement

用爬虫获取猫眼电影top100数据

阅读量:

分析:

  • 第一步:

明确本次数据采集所针对的网络地址为http://maoyan.com/board/4,打开之后便可以看到榜单信息

在这里插入图片描述
  • 第二步:

在排名列表中位列第一的影片为《霸王别姬》,页面上呈现的有效内容包括影片名称、主演、上映时间、上映地区、评分、图片 等相关数据。(这些即为我们需要抓取的关键信息

  • 第三步:

当进入网站首页后,发现每页仅展示10部影片的信息,而我们的目标是获取top100榜单。在点击第二页时,观察到页面的URL相较于首页多出一个参数(https://maoyan.com/board/4?offset=10),当我们再次点击下一页的时候URL变为了(https://maoyan.com/board/4?offset=20)因此我们猜测offset是一个代表偏移量的参数,我们可以通过这个变量来控制我们访问的页面,以便可以访问top100所有的数据。

  • 因此,整个操作流程应划分为以下步骤:
    ① 获取猫眼电影首页的网页内容
    ② 利用正则表达式从网页数据中筛选出所需的信息
    ③ 调整off

全部评论 (0)

还没有任何评论哟~