数据界的达克摩斯之剑——深入浅出地介绍网络爬虫(Forth)
发布时间
阅读量:
阅读量
目录
3.爬虫身份识别
4.用户爬虫的例子
4.1 开源爬虫
网络爬虫的组成
控制器
解析器
资源库
3.爬虫身份识别
网站抓取器会向网络服务器发送http请求,并在请求头部分植入用户代理字段(User Agent),以表明其身份特征。
网站管理员则通过查看服务器日志记录(Log Entry),利用用户代理字段来识别哪些爬取器曾访问过目标网站以及其使用频率。
用户代理字段有时还会包含一个指向爬取器更多信息资源的链接(URL)。然而需要注意的是,在某些恶意情况下(如邮件抓取器或不明来源的爬取工具),该字段通常不会提供任何有用信息。
为了便于网站管理员能够联系到抓取器的所有者(Owner),留下用户的标识信息是十分重要的。
如果某个网站管理员想了解某个特定抓取
全部评论 (0)
还没有任何评论哟~
