Advertisement

网页正文识别与提取算法基于特征分块

阅读量:

正文特征定义与解析

网页的构成主要包含以下三个组成部分:

  • 主体内容
  • 超链接文字(锚点)
  • 元数据标签

网页中的主体内容通常占据较大的空间,包含大量语句以及标点符号。这些特征可以被用来对主体内容进行快速的分块处理。

网页分块

当浏览器展示网页内容时,会将具有相似信息的页面进行集中排列。

在这里插入图片描述

我们可以将注意力集中在用于描述页面布局结构的标签上,例如table、tr、td以及div等。同时,也可以关注诸如b、title和hn这类用于表达主题内容的标签。

具体实施流程大致包括以下几个环节:

  • 对网页内容进行区块划分
  • 确定每个区块的起始与终止位置,并提取对应的标签信息
  • 接下来对区块进行细分,并通过深度优先的方式逐层进行标记
  • 直至达到预设的结束位置

该分块算法充分借助了HTML标签结构所具备的特性。

预处理

在进行计算操作之前,应当首先清除那些非必要的标签信息,例如样式标签或脚本标签等,此类工作可以通过相关工具来完成。

计算

复制代码
    field text_length;

全部评论 (0)

还没有任何评论哟~