Skip to main content
QUICK REVIEW

[论文解读] A Holistic Representation Guided Attention Network for Scene Text Recognition

Yang Lu, Dang, Fan|arXiv (Cornell University)|Apr 2, 2019
Handwritten Text Recognition Techniques参考文献 33被引用 5
一句话总结

该论文提出了一种基于整体图像表征引导的注意力网络,用于场景文本识别,直接将2D卷积神经网络(CNN)特征连接到基于注意力的序列解码器,无需中间序列表征。通过使用整体图像表征来引导2D空间注意力,该模型在不规则和规则的场景文本基准上均实现了最先进性能,同时支持并行训练,与基于RNN的模型相比,反向传播速度提升1.5倍至9.4倍,前向传播速度提升1.3倍至7.9倍,且仅需词级别标注。

ABSTRACT

Reading irregular scene text of arbitrary shape in natural images is still a challenging problem, despite the progress made recently. Many existing approaches incorporate sophisticated network structures to handle various shapes, use extra annotations for stronger supervision, or employ hard-to-train recurrent neural networks for sequence modeling. In this work, we propose a simple yet strong approach for scene text recognition. With no need to convert input images to sequence representations, we directly connect two-dimensional CNN features to an attention-based sequence decoder which guided by holistic representation. The holistic representation can guide the attention-based decoder focus on more accurate area. As no recurrent module is adopted, our model can be trained in parallel. It achieves 1.5x to 9.4x acceleration to backward pass and 1.3x to 7.9x acceleration to forward pass, compared with the RNN counterparts. The proposed model is trained with only word-level annotations. With this simple design, our method achieves state-of-the-art or competitive recognition performance on the evaluated regular and irregular scene text benchmark datasets.

研究动机与目标

  • 为解决在自然图像中识别不规则形状文本的挑战,该挑战因复杂的空间布局而难以处理。
  • 消除对中间序列表征和基于RNN的编码器的需求,后者本质上是顺序的,难以实现并行训练。
  • 通过引入整体图像表征作为解码器的引导,提升2D特征空间中的注意力定位精度。
  • 仅使用词级别标注实现强大的识别性能,避免昂贵的字符级别标注需求。
  • 通过用非循环、可并行化的基于注意力的解码器替代循环网络,实现更快的训练和推理。

提出的方法

  • 模型使用2D卷积神经网络提取输入图像的特征图和整体表征,跳过序列转换步骤。
  • 将整体表征与解码器的隐藏状态拼接,以在解码过程中引导对特征图的2D空间注意力。
  • 采用带有2D交叉注意力的基于注意力的解码器,为每个字符预测关注特征图中的相关空间区域。
  • 解码器为非循环且完全可微分,支持并行训练并实现更快收敛。
  • 模型采用端到端训练,仅需词级别标注,无需字符级别标签或后处理。
  • 整体表征通过全局平均池化计算,并投影为上下文向量,用于调制注意力权重。

实验结果

研究问题

  • RQ1整体图像表征能否提升不规则场景文本识别中2D特征图的注意力定位精度?
  • RQ2用非循环、可并行化的解码器替代RNN是否能在不损失准确率的前提下提升训练速度?
  • RQ3仅使用词级别标注的简单模型架构能否在不规则文本识别基准上实现最先进性能?
  • RQ4在规则和不规则文本数据集上,该方法与基于RNN和序列到序列的模型相比,在速度和准确率方面表现如何?
  • RQ5该模型的主要失败模式是什么?它们与图像质量及文本方向有何关联?

主要发现

  • 在IC15-1811数据集上,该模型达到79.5%的准确率,较之前最佳的词级别方法(76.1%)提升3.4个百分点。
  • 在CT80数据集上,该模型达到85.4%的准确率,较先前最先进词级别方法(84.4%)提升1.0个百分点。
  • 在IIIT5K数据集上,该模型达到94.7%的准确率,优于最佳词级别基线模型(94.3%),且与字符级别模型具有竞争力。
  • 由于非循环设计,该模型的反向传播速度比基于RNN的模型快1.5倍至9.4倍,前向传播速度快1.3倍至7.9倍。
  • 失败案例主要源于图像模糊、分辨率低、竖直文本、光照变化和遮挡,其中竖直文本因合成数据集中样本稀缺而构成特别挑战。
  • 注意力机制能有效聚焦于相关字符区域,尽管在注意力图中偶尔观察到轻微的位置偏移。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。