Advertisement

静态网页使用urllib3库进行爬取

阅读量:

3 静态网页爬取

  • 3.1 介绍

    • 静态网页
    • 爬虫的基本流程
  • 3.2 通过urllib3库实现爬取请求

    • 首先执行发起请求操作
      • 设置必要的HTTP头信息参数
      • 在线设置超时时间参数以避免连接失败问题
      • 定义合理的重试策略以确保成功获取目标资源
      • 构建完整的HTTP 请求数据结构包括方法参数路径等要素
      • 最终完成整个爬取过程并保存结果数据

3.1 介绍

静态网页

在网站设计中,基于纯HTML语言构建的网站文件一般被定义为“静态页面”。这种页面类型通常由标准通用标记语言(HTML)开发,并以其常见文件扩展名为.htm或.html而识别。其特点在于能够嵌入多种媒体元素如文本文件、图片、音频以及Flash动画等;同时还可以集成客户端脚本和ActiveX组件,并提供简单的Java小程序运行环境。作为网站建设的核心组件之一,在早期互联网应用中几乎全部采用纯静态页面作为构建基础。与动态网站相比,则表现出不依赖后端数据库系统、不包含运行时程序逻辑且不具备交互功能的特点。

爬虫的基本流程

  1. 发起请求:调用HTTP库接口向目标网站发送一个Request指令(即发送一个Request),该Request命令可能包含附加的headers参数以提供额外的信息,并等待服务

全部评论 (0)

还没有任何评论哟~