Advertisement

Python3网络爬虫开发(2)基础库

阅读量:

文章结构概览

  • 一、urllib
      • 1. urlparse 用于完成 URL 的解析与拆分工作
      • 2. urlunparse 负责生成完整的 URL 地址
      • 3. urljoin 实现两个网址之间的连接操作
      • 4. urlencode 可将参数字典转换为字符串形式的参数
      • 5. parse_qs 和 parse_qsl 能够将参数字符串还原为字典或列表结构
      • 6. quote 和 unquote 分别执行对 URL 中中文字符的编码与解码任务
    • 二、requests

      • 1. 发送 GET 类型请求
      • 2. 提交 POST 类型请求
      • 3. 维护会话状态
      • 4. 处理响应内容
      • 5. 实现身份验证机制
      • 6. 配置代理服务器
      • 7. 构建预处理请求对象
    • 三、httpx

      • 1. 兼容 requests 接口风格
      • 2. 支持异步操作模式
    • 四、基础爬虫实践应用

一、urllib库功能与应用

与其它库相比,urllib 在构建请求方面虽然较为繁琐,但其在解析链接方面的功能却十分便捷,能够胜任底层请求的构建工作。

1. urlparse 实现 UR

全部评论 (0)

还没有任何评论哟~