Skip to main content
QUICK REVIEW

[论文解读] Double Supervised Network with Attention Mechanism for Scene Text Recognition

Yuting Gao, Zheng Huang|arXiv (Cornell University)|Aug 2, 2018
Handwritten Text Recognition Techniques参考文献 29被引用 8
一句话总结

本文提出 DSAN,一种用于无词典场景文本识别的双监督端到端深度学习框架,整合了文本注意力模块和两个监督分支:一个用于上下文级建模,另一个用于字符级语义增强。通过多任务学习联合优化显式和隐式语义信息,该方法在 IIIT5K、ICDAR2013 和 SVT 基准测试上分别实现了 88.6%、92.3% 和 84.1% 的最先进准确率。

ABSTRACT

In this paper, we propose Double Supervised Network with Attention Mechanism (DSAN), a novel end-to-end trainable framework for scene text recognition. It incorporates one text attention module during feature extraction which enforces the model to focus on text regions and the whole framework is supervised by two branches. One supervision branch comes from context-level modelling and another comes from one extra supervision enhancement branch which aims at tackling inexplicit semantic information at character level. These two supervisions can benefit each other and yield better performance. The proposed approach can recognize text in arbitrary length and does not need any predefined lexicon. Our method outperforms the current state-of-the-art methods on three text recognition benchmarks: IIIT5K, ICDAR2013 and SVT reaching accuracy 88.6%, 92.3% and 84.1% respectively which suggests the effectiveness of the proposed method.

研究动机与目标

  • 为解决在自然、非约束环境下识别场景文本的挑战,其中文本可能缺乏显式语义上下文。
  • 在不依赖预定义词典的前提下,提升对任意长度文本序列的识别性能。
  • 通过注意力机制和多监督策略,增强模型对低质量、杂乱或退化文本图像的鲁棒性。
  • 联合建模场景文本中的显式上下文关系与隐式字符级语义。

提出的方法

  • 该框架采用基于 ResNet-34 的主干网络,并通过修改步长以生成 1/8 分辨率的特征图,随后通过一个文本注意力模块,该模块应用带有 Sigmoid 激活函数的 3x1 卷积来生成空间注意力掩码。
  • 将注意力掩码与特征图进行广播乘法操作,生成注意力加权特征,从而抑制无关区域并增强与文本相关的特征。
  • 将注意力增强后的特征输入到两个并行分支中:一个使用双层双向 LSTM 的上下文级建模分支,用于捕捉序列依赖关系。
  • 一个额外的监督增强分支通过字符级分类器在字符级别建模隐式语义信息,提供第二个监督信号。
  • 两个分支通过多任务损失函数进行联合训练,其中超参数 λ 控制上下文级与字符级监督之间的平衡。
  • 在推理阶段,转录输出来自上下文级建模分支,而字符级分支则在训练过程中辅助学习鲁棒表示。

实验结果

研究问题

  • RQ1双监督机制是否能通过同时建模显式上下文关系与隐式字符级语义来提升场景文本识别性能?
  • RQ2集成可学习的注意力模块以突出文本区域,是否能提升在具有挑战性的低质量场景图像上的识别准确率?
  • RQ3监督增强分支在缺乏强上下文线索的文本序列上,性能提升程度如何?
  • RQ4上下文级与字符级监督的联合训练在多样化基准测试上的泛化能力如何?

主要发现

  • DSAN 在 IIIT5K 基准测试上实现了 88.6% 的最先进准确率,显著优于先前方法。
  • 在 ICDAR2013 上,模型达到 92.3% 的准确率,比之前最先进方法高出 1.5 个百分点。
  • 在 SVT 数据集上,DSAN 实现了 84.1% 的准确率,相较于无监督增强分支的基线模型提升了 8.4 个百分点。
  • 消融实验证实,与基线相比,监督增强分支在 IIIT5K 上提升准确率 5.0%,在 ICDAR2013 上提升 3.1%,在 SVT 上提升 6.7%。
  • 文本注意力模块在 SVT 上带来 1.7% 的准确率增益,证明其在抑制背景杂波和增强文本特征方面的有效性。
  • 模型在多种场景文本条件下表现出良好的泛化能力,包括字体多变、模糊和光照不均等情况,如定性示例所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。