简易数据分析 09 | WebScraper 自动抓取数量 & WebScraper 父选择器
发布时间
阅读量:
阅读量

这是简易数据分析系列的第 9 篇 文章。
今天,我们来探讨Web Scraper的几个小功能:自动生成抓取次数以及父级元素和子级元素的选择机制。
如何只抓取前 100 条数据?
按照上篇教程依次完成下去的话,你可能会发现这个爬虫会持续运行下去.当网页的数据量达到1千条时,它就会开始抓取相应的数据.如果是达到1万条的情况,也会进行相应的数据采集.如果我们只需要获取前2百条数据的话,该怎么办呢?
如果你主动终止 抓取数据的网页程序运行,则会发现所有收集到的数据都彻底失去 ,没有任何数据会被保存下来 ,因此这种方法不可行 。我们目前有两种机制可供使用以停止 Web Scraper 的抓取过程
1.断网大法
当您感觉数据收集已经接近完成时,请考虑断开该设备的网络连接。一旦中断网络连接,则浏览器将无法访问数据源;这会导致Web Scraping工具误判为已抓取完整并触发停止机制;随后系统将执行自动
全部评论 (0)
还没有任何评论哟~
