网络爬虫动态HTML处理
发布时间
阅读量:
阅读量
一、常见的反爬虫技术
当在某个网页中发现使用了 jQuery 时,在进行数据采集时需格外谨慎。jQuery 具备动态生成 HTML 内容的能力,相关内容仅在 JavaScript 代码执行完成后才会呈现。若采用常规手段获取页面内容,则只能获取到 JavaScript 执行前的静态页面信息。
部分网站所采用的反爬虫策略,通常涵盖 ajax、DHTML 等技术手段。
1、什么是ajax?
实现与网站服务器进行信息交互的唯一途径,即通过发送 HTTP 请求以获取新的页面内容。若在提交表单或从服务器获取数据后,网页无需进行刷新操作,则说明所访问的网站正在采用 Ajax 技术进行数据处理。
Ajax 并非一种编程语言,而是一组用于执行网络通信任务的技术集合(其功能可类比于网络数据采集)。其完整名称为 Asynchronous JavaScript and XML(异步 JavaScript 和 XML),该技术使网站能够在不依赖独立页面请求的情况下,与服务器实现信息的交互与传输。
2、什么是DHTML?
与 Ajax 技术相似,动态 HTML(Dynamic HTML,DHTML)同样是一组旨在应对网络应用中各类问题的技术手段。DHTML 的核心在于通过客户端编程语言对网页中的 HTML 元素(包括 HTML 代码、CSS 样式或两者同时修改)进行实
全部评论 (0)
还没有任何评论哟~
