Advertisement

A fully supervised neural network for image-based sequence recognition

阅读量:

Abstract

基于图像的空间信息序列识别一直是计算机视觉领域的重要研究方向之一。本文围绕场景文本识别这一关键问题展开了深入探讨,在基于图像的空间信息序列识别领域中占据核心地位且难度较大。我们提出了一种创新性的神经网络架构,在特征提取、序列建模以及编码转换等多个环节实现了有机统一。相较于现有场景文本识别系统而言,在以下四个方面具有显著优势:(1)该架构支持端到端自动学习与训练过程,并非传统方法中各个组件独立优化;(2)无需额外处理输入序列长度问题;(3)完全不受传统词表限制;(4)生成规模显著缩减但依然有效的模型结构,并且在有词典与无词典场景下的文本识别任务中均展现出优异性能。我们在IIIT-5K、街景文本以及ICDAR等基准数据集上的实验表明:所提出的算法不仅性能优越而且具有良好的泛化能力;此外,在音乐乐谱图像识别等实际应用任务中的表现同样令人满意

1. Introduction

最近,在会议上已观察到神经网络的复兴现象。这一现象主要是由于深度神经网络模型(特别是深度卷积神经网络(DCNN))在多个视觉任务中取得巨大成功所引发的。然而,在与深度神经网络相关的大部分研究工作集中于对象类别检测或分类任务[12,25]。本文重点探讨计算机视觉中的一个经典问题:基于图像的序列识别问题。在现实世界场景中,稳定的视觉对象(如场景文本、手写符号及乐谱)往往会以序列形式

全部评论 (0)

还没有任何评论哟~