Skip to main content
QUICK REVIEW

[论文解读] Decoupled Attention Network for Text Recognition

Tianwei Wang, Yuanzhi Zhu|arXiv (Cornell University)|Dec 21, 2019
Handwritten Text Recognition Techniques参考文献 45被引用 8
一句话总结

本文提出了一种用于文本识别的解耦注意力网络(DAN),将对齐操作与历史解码结果分离,仅基于视觉特征使用卷积对齐模块(CAM)。通过将对齐与循环解码解耦,DAN 减少了误差累积,在多个文本识别基准上实现了最先进性能,包括手写文本和不规则场景文本,同时对文本长度和图像干扰表现出更优的鲁棒性。

ABSTRACT

Text recognition has attracted considerable research interests because of its various applications. The cutting-edge text recognition methods are based on attention mechanisms. However, most of attention methods usually suffer from serious alignment problem due to its recurrency alignment operation, where the alignment relies on historical decoding results. To remedy this issue, we propose a decoupled attention network (DAN), which decouples the alignment operation from using historical decoding results. DAN is an effective, flexible and robust end-to-end text recognizer, which consists of three components: 1) a feature encoder that extracts visual features from the input image; 2) a convolutional alignment module that performs the alignment operation based on visual features from the encoder; and 3) a decoupled text decoder that makes final prediction by jointly using the feature map and attention maps. Experimental results show that DAN achieves state-of-the-art performance on multiple text recognition tasks, including offline handwritten text recognition and regular/irregular scene text recognition.

研究动机与目标

  • 解决基于注意力机制的文本识别中因递归解码导致的误差传播引发的对齐问题。
  • 降低注意力机制对历史解码状态的依赖,以提升对齐稳定性。
  • 开发一种灵活的端到端文本识别框架,确保在多种文本类型中保持高性能。
  • 增强对长序列和真实世界文本识别中常见的细微图像干扰的鲁棒性。
  • 在 IIIT-5K、IC13、IC03、SVT-P 和 CUTE80 等标准基准上实现最先进结果。

提出的方法

  • 提出一种仅基于卷积神经网络编码器视觉特征的卷积对齐模块(CAM),计算注意力图,消除对隐藏状态或先前标记嵌入的依赖。
  • 将解码器解耦为 CAM 对齐模块和独立的 GRU 基文本解码器,后者联合关注特征图和注意力图。
  • 以通道维度方式使用全卷积网络(FCN),从多尺度视觉特征生成空间密集的注意力图。
  • 采用双向 GRU 解码器进行最终字符预测,同时利用视觉特征和注意力特征。
  • 使用 ADADELTA 优化器进行端到端训练,初始学习率固定为 1.0,第三轮后降低至 0.1。
  • 支持 DAN 的 1D 和 2D 变体(DAN-1D 和 DAN-2D),以灵活适应规则和不规则文本布局。

实验结果

研究问题

  • RQ1将对齐操作与递归解码解耦是否能提升基于注意力机制的文本识别性能?
  • RQ2仅使用视觉特征进行对齐是否能减少长序列或复杂文本序列中的误差累积和对齐错误?
  • RQ3所提出的 DAN 模型在规则和不规则场景文本识别基准上与最先进方法相比表现如何?
  • RQ4DAN 对图像干扰(如填充、拉伸或边界框扩展)的鲁棒性如何?
  • RQ5解耦架构是否能在包括手写文本和弯曲文本在内的多种文本类型中保持高性能?

主要发现

  • DAN 在 IIIT-5K 和 IC03 上实现了规则场景文本识别的最先进性能,且在 SVT 和 IC13 上的性能与当前最先进方法相当。
  • DAN-2D 在 SVT-Perspective 和 CUTE80 上取得最先进结果,优于现有基于 2D 的方法在不规则文本上的表现。
  • DAN 对图像干扰表现出更优的鲁棒性:在 IIIT-p、IIIT-r-p、IC13-ex 和 IC13-r-ex 等 IIIT-5K 和 IC13 的扰动版本上,其性能始终优于 CA-FCN。
  • 由于对齐过程中的误差传播减少,该模型在长文本识别中表现显著优势,尤其在手写文本识别中。
  • 消融实验证实,CAM 仅依赖视觉特征可提升对齐稳定性,并降低对解码错误的敏感性。
  • 该模型的灵活性支持 1D 和 2D 变体之间的无缝切换,无需架构重构即可适应不同文本布局。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。