EAST: Efficient and accurate text detector
发布时间
阅读量:
阅读量
该篇研究发表于2017年CVPR会议,文中提出了一种高效且精准的场景文字检测模型,能够迅速并准确地完成文字区域的定位。该技术方案通过单一神经网络直接从整张图像中预测出任意方向的四边形文本行,从而省去了传统流程中的多个中间环节(如候选区域聚合和单词分割)。该方法特别强调了损失函数的设计以及神经网络结构的构建。实验结果在多个经典数据集上进行验证,包括ICDAR2015、COCO-Text和MSRA-TD500等,充分证明了所提出的算法在精度与效率方面均表现出色。在ICDAR2015数据集上,该方法在分辨率为720p时实现了13.2fps的处理速度,并取得了F得分为0.782的成绩。
论文核心思想
- 提出了一种基于两阶段策略的文字检测框架:首先利用全卷积网络(FCN)提取特征,随后通过非极大值抑制(NMS)对检测结果进行优化处理,从而去除冗余步骤并提升检测速度
- 所述方法不仅适用于单词级别的检测任务,同时也支持文本行级别的识别工作。可识别的文本形状为任意四边形形式:既包括旋转矩形(图中绿色框所示),也涵盖常规四边形(图中蓝色框所示)
- 引入了具有局部感知能力的NMS机制对生成的几何形状进行筛选
流程设计
本文所采用的思想较为简洁明了,融合了DenseBox与Unet网络的优势特性。具体实现过程如下:
- 首先采用一个通用的基础网络(文中选
全部评论 (0)
还没有任何评论哟~
