网页正文识别与提取算法基于特征分块
发布时间
阅读量:
阅读量
正文特征定义与解析
网页的构成主要包含以下三个组成部分:
- 主体内容
- 超链接文字(锚点)
- 元数据标签
网页中的主体内容通常占据较大的空间,包含大量语句以及标点符号。这些特征可以被用来对主体内容进行快速的分块处理。
网页分块
当浏览器展示网页内容时,会将具有相似信息的页面进行集中排列。

我们可以将注意力集中在用于描述页面布局结构的标签上,例如table、tr、td以及div等。同时,也可以关注诸如b、title和hn这类用于表达主题内容的标签。
具体实施流程大致包括以下几个环节:
- 对网页内容进行区块划分
- 确定每个区块的起始与终止位置,并提取对应的标签信息
- 接下来对区块进行细分,并通过深度优先的方式逐层进行标记
- 直至达到预设的结束位置
该分块算法充分借助了HTML标签结构所具备的特性。
预处理
在进行计算操作之前,应当首先清除那些非必要的标签信息,例如样式标签或脚本标签等,此类工作可以通过相关工具来完成。
计算
field text_length;
全部评论 (0)
还没有任何评论哟~
