静态网页使用urllib3库进行爬取
发布时间
阅读量:
阅读量
3 静态网页爬取
-
3.1 介绍
-
- 静态网页
- 爬虫的基本流程
-
3.2 通过urllib3库实现爬取请求
- 首先执行发起请求操作
- 设置必要的HTTP头信息参数
- 在线设置超时时间参数以避免连接失败问题
- 定义合理的重试策略以确保成功获取目标资源
- 构建完整的HTTP 请求数据结构包括方法参数路径等要素
- 最终完成整个爬取过程并保存结果数据
- 首先执行发起请求操作
3.1 介绍
静态网页
在网站设计中,基于纯HTML语言构建的网站文件一般被定义为“静态页面”。这种页面类型通常由标准通用标记语言(HTML)开发,并以其常见文件扩展名为.htm或.html而识别。其特点在于能够嵌入多种媒体元素如文本文件、图片、音频以及Flash动画等;同时还可以集成客户端脚本和ActiveX组件,并提供简单的Java小程序运行环境。作为网站建设的核心组件之一,在早期互联网应用中几乎全部采用纯静态页面作为构建基础。与动态网站相比,则表现出不依赖后端数据库系统、不包含运行时程序逻辑且不具备交互功能的特点。
爬虫的基本流程
- 发起请求:调用HTTP库接口向目标网站发送一个Request指令(即发送一个Request),该Request命令可能包含附加的headers参数以提供额外的信息,并等待服务
全部评论 (0)
还没有任何评论哟~
