Advertisement

行百里者半九十—— scrapy

阅读量:

scrapy 持久化存储(以糗事百科为例)

    • 前言
    • 基于终端指令的持久化存储
    • 基于管道的持久化存储

前言

不知道大家是否还记得完成爬取任务的核心三步骤呢?也就是首先需要获取目标网站的起始链接位置,并通过发送网络请求访问目标网站;接着根据返回的内容解析所需的网页信息;最后将获取的数据进行持久化存储处理。

之前我们在 scrapy 框架(1)中对指定 URL 和发送请求的基本用法进行了简要学习。接下来的问题是如何利用 scrapy 实现数据持久化存储。

之前我们在 scrapy 框架(1)中对指定 URL 和发送请求的基本用法进行了简要学习。接下来的问题是如何利用 scrapy 实现数据持久化存储。

scrapy 框架提供两种途径来实现数据持久化存储功能。第一种途径是以更加系统化的管理流程为基础;第二种途径则采用了更为高效的管道机制来进行数据传输与处理。具体而言,在第一种方式中,默认会基于终端命令的操作模式来完成相关操作;而在第二种方式中,则会利用管道机制来进行高效的数据传输与处理。

基于终端指令的持久化存储

在本节中, 我们将详细说明如何使用Scrapy框架编写爬虫程序。为此, 首先需要在项目根目录下创建一个专门的scrapy文件, 用于编写与指定URL相关的请求发送程序。在这个过程中, 我们将采用我们之前学

全部评论 (0)

还没有任何评论哟~