Skip to main content
QUICK REVIEW

[论文解读] A Multi-Object Rectified Attention Network for Scene Text Recognition

Canjie Luo, Lianwen Jin|arXiv (Cornell University)|Jan 10, 2019
Handwritten Text Recognition Techniques参考文献 55被引用 12
一句话总结

本文提出MORAN,一种用于场景文本识别的多目标校正注意力网络,结合多目标校正网络(MORN)将不规则、扭曲的文本转换为可读的水平对齐形式,随后通过基于注意力的序列识别网络(ASRN)实现精确的文本预测。该方法仅使用图像-文本对进行弱监督训练,在多个基准数据集上取得最先进性能,包括SVT-Perspective和CUTE80等具有挑战性的不规则文本数据集,展现出对透视、弯曲和尺度变化的强鲁棒性。

ABSTRACT

Irregular text is widely used. However, it is considerably difficult to recognize because of its various shapes and distorted patterns. In this paper, we thus propose a multi-object rectified attention network (MORAN) for general scene text recognition. The MORAN consists of a multi-object rectification network and an attention-based sequence recognition network. The multi-object rectification network is designed for rectifying images that contain irregular text. It decreases the difficulty of recognition and enables the attention-based sequence recognition network to more easily read irregular text. It is trained in a weak supervision way, thus requiring only images and corresponding text labels. The attention-based sequence recognition network focuses on target characters and sequentially outputs the predictions. Moreover, to improve the sensitivity of the attention-based sequence recognition network, a fractional pickup method is proposed for an attention-based decoder in the training phase. With the rectification mechanism, the MORAN can read both regular and irregular scene text. Extensive experiments on various benchmarks are conducted, which show that the MORAN achieves state-of-the-art performance. The source code is available.

研究动机与目标

  • 解决复杂扭曲(如透视、弯曲和旋转)的不规则场景文本识别挑战。
  • 通过弱监督方法将不规则文本转换为更易读的校正形式,降低识别难度。
  • 通过分数采样方法增强上下文敏感性,提升基于注意力的序列识别性能。
  • 通过课程学习实现校正与识别联合框架的端到端训练。
  • 开发一种灵活的、无需几何信息的校正机制,无需真实空间标注即可泛化于多种文本形变。

提出的方法

  • MORAN框架由多目标校正网络(MORN)组成,该网络学习从坐标网格预测偏移网格,实现不规则文本的空间变换,使其变为更水平且紧密包围的形式。
  • MORN采用弱监督方式训练,仅依赖图像和文本标签,无需几何或像素级监督。
  • 基于注意力的序列识别网络(ASRN)处理校正后的图像,通过关注相关特征区域生成字符序列。
  • 在训练中引入分数采样方法,随机在多尺度拉伸特征图,扩展感受野,提升对上下文变化的鲁棒性。
  • 采用课程学习策略,先固定一个子网络(MORN或ASRN)以优化另一个,随后对整个网络进行联合微调。
  • 框架使用类似可微空间变换器的机制,使梯度能通过校正过程反向传播,支持端到端训练。

实验结果

研究问题

  • RQ1弱监督校正网络是否能在无几何监督的情况下有效处理如透视和弯曲等复杂文本扭曲?
  • RQ2分数采样方法如何提升注意力机制在序列识别中的敏感性与鲁棒性?
  • RQ3与独立模型相比,校正与识别的联合训练在不规则场景文本识别上的性能提升程度如何?
  • RQ4MORAN框架在包含低分辨率和弯曲文本等复杂变化的基准数据集上的表现如何?
  • RQ5所提方法是否能泛化到具有任意形状和复杂背景的真实世界场景文本?

主要发现

  • MORAN在多个基准数据集上达到最先进性能,包括IIIT5K、SVT、ICDAR2003、ICDAR2013、ICDAR2015、SVT-Perspective和CUTE80。
  • 在SVT-Perspective数据集上,MORAN即使不使用词典也优于所有基线模型,使用50个词的词典时词准确率达到87.6%,不使用词典时为85.2%。
  • 模型成功校正了小曲率角度的弯曲文本,CUTE80上的定性结果表明,大多数弯曲实例均被正确识别。
  • 分数采样方法显著提升了注意力解码器的鲁棒性,增强了序列预测过程中的对齐与上下文建模能力。
  • 课程学习策略通过分阶段优化MORN和ASRN,再进行端到端微调,提升了训练稳定性和最终性能。
  • 尽管在处理极大曲率角度或复杂背景时存在局限,MORAN在裁剪后、水平对齐的不规则文本上表现出强大的泛化能力,标准基准中的失败案例极少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。