Advertisement

Evaluation of deep convolutional nets in document image classification and retrieval: a paper note

阅读量:

摘要内容提炼

基于深度卷积神经网络所提取的特征,本文设计出一种适用于文档图像分类与检索的新技术。在物体识别及场景理解任务中,深度神经网络能够从像素级输入数据中逐层提取抽象特征,并以简洁的方式加以表达。当前文档分析领域的部分研究结果指出,深度学习所采用的特征表达方式相较于传统常用的人工设计特征更具优势。实验结果进一步显示:
(i)从卷积神经网络中获取的特征具备良好的抗压缩能力;
(ii)在非文档图像上进行训练的卷积神经网络模型可有效应用于文档分析任务;
(iii)当拥有充足训练样本时,无需专门针对特定领域开展特征学习。
此外,本文还构建了一个带有标签的IIT-CDIP子集,该数据集包含400,000张属于16个类别的文档图像,可用于训练卷积神经网络以实现文档分析目标。

1 介绍

多种类型的文档往往具备各自独特的视觉特征。例如,书信类文档一般遵循固定的格式进行书写,即便在文本内容无法辨识的情况下,其格式依然具有可识别性。受到这一现象的启发,本文围绕文档图像的视觉结构与排版方式,探讨了文档分类与检索的相关问题。

基于文本内容的文档图像分析技术可以广泛应用于多个领域。在数字化图书馆中,许多文档在被光学字符识别(OCR)系统处理前通常以图像形式进行存储,这表明基础的图像分析是实现索引与分类的主要手段。在预处理阶段,通过文档图像分析能够提供关于每

全部评论 (0)

还没有任何评论哟~