Advertisement

Python3网络爬虫开发与实战(5)Ajax 数据爬取

阅读量:

文章结构概述

  • 一、Ajax 的概念解析
      • 1. 实例引入
      • 2. 基本原理
    • 二、Ajax 分析方法

      • 1. 查看请求
      • 2. 过滤请求
    • 三、Ajax 结果提取

      • 1. 分析请求
      • 2. 分析响应
      • 3. 实战演练
    • 四、分析 Ajax 爬取今日头条街拍美图

      • 1. 抓取分析
      • 2. 实战演练

这里由于 Ajax 相关内容较为基础,直接引用原文中的表述即可。

在使用 requests 库进行页面抓取时,有时会发现获取到的内容与浏览器中显示的结果存在差异。虽然浏览器能够正常展示页面数据,但通过 requests 获取的原始 HTML 却未包含这些信息。其根本原因在于 requests 只能获取未经处理的 HTML 内容,而浏览器中的内容则是经过 JavaScript 动态生成的,这些数据可能来源于多种途径,包括通过 Ajax 请求加载、嵌入在 HTML 文档中,或由 JavaScript 结合特定算法计算得出。

其中一种典型的数据加载方式为异步加载机制。初始页面加载时并不包含所有数据,在完成基本页面渲染后,会向服务器发起额外请求以获取所需信息,并对返回的数据进行处理后展示在网页上。这一过程实质上就是一次 Ajax 请求的执行。

全部评论 (0)

还没有任何评论哟~