Advertisement

爬虫

阅读量:
零、背景知识
  1. 爬取系统是一个自动化的程序设计框架。
  2. 爬取流程概述如下:
    • 目标网站托管于特定服务器,并持续24小时在线运行。
    • 当执行爬取时, 系统首先模拟浏览器行为发送网络请求。
    • 通过 Http 库向目标服务器发起隐秘的网络请求。
    • 模仿浏览器身份(附加必要的Header信息)
    • 大多数服务器(但很多服务器安装了防抓包技术)
    • 把数据返回给爬取系统.
    • 处理完毕后将获取的数据进行存储。
  3. 学习的模块化内容包括
  • 抓包
  • 数据爬取
  • 数据解析
  • 数据存储
  • 数据分析:可视化
  • 爬虫框架:scrapy、
  1. 学习的教程地址

一、在chrome浏览器中进行抓包

访问某个网站时(按下Fn+F12键),将开启开发者模式。
单击"Network"选项卡以查看网络请求信息。
在HTTP中存在多种请求方法:GET、POST、PUT、DELETE、HEAD、OPTIONS以及TRACE等方法;其中应用最广泛的两种便是GET与POST方法。

全部评论 (0)

还没有任何评论哟~