Fast CNN-based approach for document layout analysis (lecture notes)
发布时间
阅读量:
阅读量
摘要内容提炼
自动文档布局分析作为认知计算与处理过程中的核心环节,其主要功能是从文档图像中抽取各类信息,例如构建特定领域的知识库、理解图表与图像内容以及从表格中提取结构化数据等。尽管近年来该领域已取得一定进展,但依然面临诸多挑战,尤其是在将检测到的内容精确归类至具有语义意义的类别方面。随着移动设备及云服务的广泛应用,对数据处理方法在速度与成本方面提出了更高要求。本文介绍了一种基于卷积神经网络的自动文档布局分析技术,能够有效处理文本、图形及表格内容。通过分析文本与表格块中所呈现出的固有线性特征,该方法将二维文档图像转化为一维特征表示,在降低计算复杂度的同时显著提升了整体性能:不仅实现了更高效的执行效率和更精简的数据消耗,同时确保了信息无损。相较于传统二维卷积神经网络方法,该方案在总体准确率方面表现更为优越。
1 介绍
文档作为多种认知过程(如知识库构建、OCR识别、图形理解、文档检索等)中的关键信息源,具有重要价值。从文档中提取信息的重要环节在于布局分析,其核心任务是识别并分类文档图像中的相关区域。
在已有研究中,针对文档图像布局分析已提出诸多方法,根据文献[11]的分类,这些方法大致可分为三类:
(i)基于区域或块的分类方法[21,17];
(ii)基于像素的分类方法[14,13];
(iii)连接组件分类方法[6,20,1]。
基
全部评论 (0)
还没有任何评论哟~
