爬虫
发布时间
阅读量:
阅读量
零、背景知识
- 爬取系统是一个自动化的程序设计框架。
- 爬取流程概述如下:
- 目标网站托管于特定服务器,并持续24小时在线运行。
- 当执行爬取时, 系统首先模拟浏览器行为发送网络请求。
- 通过 Http 库向目标服务器发起隐秘的网络请求。
- 模仿浏览器身份(附加必要的Header信息)
- 大多数服务器(但很多服务器安装了防抓包技术)
- 把数据返回给爬取系统.
- 处理完毕后将获取的数据进行存储。
- 学习的模块化内容包括
- 抓包
- 数据爬取
- 数据解析
- 数据存储
- 数据分析:可视化
- 爬虫框架:scrapy、
一、在chrome浏览器中进行抓包
访问某个网站时(按下Fn+F12键),将开启开发者模式。
单击"Network"选项卡以查看网络请求信息。
在HTTP中存在多种请求方法:GET、POST、PUT、DELETE、HEAD、OPTIONS以及TRACE等方法;其中应用最广泛的两种便是GET与POST方法。
全部评论 (0)
还没有任何评论哟~
