Advertisement

Java网络爬虫基础使用HttpClient和Jsoup

阅读量:

一、网络爬虫概述

网络爬虫 :是一种依据特定规则,自动获取万维网信息的程序或脚本。

应用场景:
1、实现搜索引擎
在频繁查询某一类信息时,往往需要在多个不同来源之间反复查找,此时可通过定向抓取数据并进行处理,将其存储至个人数据库中,例如使用ES进行存储,之后通过ES实现全文检索,从而更加高效地获取所需信息。
2、数据分析
当需要在某一领域做出决策时,通常需要借助大数据作为支撑。在当前以技术为依托、以数据为驱动的互联网时代,例如当下流行的自媒体运营中,可以通过分析自身文章的数据来了解表现情况。然而若想进一步查看竞争对手或整个行业的整体数据,则手工逐一统计显然效率低下。此时便可利用爬虫技术获取目标内容的数据,并对其进行整理和分析。
3、内容生产
对于新建立的网站而言,在初期缺乏内容的情况下,可以通过爬虫抓取网络资源,并对采集到的数据进行整理、加工与存储,以此丰富网站内容。

二、HttpClient应用与分析

1、无参get请求

借助网络爬虫技术获取百度首页内容
导入所需依赖模块:

复制代码
    <dependencies>
        <!--HTTP通信库,类似浏览器使用-->
        <dependency>
            <groupId>org.apache.http

全部评论 (0)

还没有任何评论哟~