Advertisement

EAST: 高效准确的场景文本检测算法译为

阅读量:

Abstract

针对场景文本检测任务,已有多种方法在多个基准测试中表现出较为理想的性能水平。然而,当面对复杂场景时,即便采用深度神经网络模型,这些方法往往仍难以实现令人满意的检测效果,这主要是由于整个处理流程中多个阶段与组件之间的协同作用对整体性能产生显著影响。在本研究中,我们设计了一种简洁且高效的处理流程,能够在自然场景下实现快速而精准的文本检测。该算法直接对整幅图像中的任意方向及四边形形状的单词或文本行进行预测,从而省去了传统方法中依赖单一神经网络所必需的中间步骤(如候选区域聚合与文字分割)。所提出的流程结构简单明了,使得研究重点能够集中于损失函数的设计以及神经网络结构的优化。通过在标准数据集(包括ICDAR 2015、COCO-Text和MSRA-TD500)上的实验验证表明,该算法在检测精度与运行效率方面均优于当前最先进的技术方案。具体而言,在ICDAR 2015数据集上,该算法在720p分辨率条件下以13.2fps的速度实现了0.7820的F-score值。

1. Introduction

近期,从自然场景中提取并理解所包含的文本信息的重要性与关注度持续上升,这一趋势通过ICDAR系列竞赛前所未有的参与规模[30,16,15]以及NIST发布的TRAIT 2016评估结果[1]得到了充分验证。文本检测作为后续处理流程的前提条件,在整个文本信息

全部评论 (0)

还没有任何评论哟~