Advertisement

爬虫基础

阅读量:

文章结构概览

  • 通用爬虫与聚焦爬虫
      • 通用爬虫

        • 普通搜索引擎(Search Engine)运行机制
        • 核心操作流程示意图
        • 爬虫功能的约束条件
        • 存在的不足之处
      • 聚焦爬虫

    • HTTP与HTTPS

      • HTTP运作方式
      • 浏览器发起HTTP请求的流程
      • URL结构解析
    • 客户端发起的HTTP请求

      • 请求信息内容
      • 请求方式Method
      • Get与Post方法详细说明
      • 常见的请求头信息
    • HTTP响应内容

      • 构成要素
      • 响应状态码分类
      • Cookie与Session机制
    • 图片下载工具

      • 构建爬虫程序的基础步骤

通用爬虫与聚焦爬虫对比

通用爬虫

通用网络爬虫作为搜索引擎抓取系统(如Baidu、Google、Yahoo等)的关键构成部分,其核心功能在于将互联网中的网页资源传输至本地,从而构建出一个完整的互联网内容镜像副本。

通用搜索引擎(Search Engine)工作原理

通用网络爬虫负责从互联网中抓取网页内容并收集相关信息,这些信息被用于构建搜索引擎的索引体系,从而为搜索服务提供支撑。爬虫的运行效率决定了搜索引

全部评论 (0)

还没有任何评论哟~