Skip to main content
QUICK REVIEW

[论文解读] SCATTER: Selective Context Attentional Scene Text Recognizer

Ron Litman, Oron Anschel|arXiv (Cornell University)|Mar 25, 2020
Handwritten Text Recognition Techniques参考文献 44被引用 7
一句话总结

SCATTER 提出了一种堆叠模块架构,结合中间监督和两步注意力解码器,以提升场景文本识别性能,尤其针对不规则文本。通过稳定深层 BiLSTM 编码器的训练并实现预测结果的逐步优化,SCATTER 实现了最先进性能,在不规则文本基准测试中相比先前方法平均准确率提升 3.7%。

ABSTRACT

Scene Text Recognition (STR), the task of recognizing text against complex image backgrounds, is an active area of research. Current state-of-the-art (SOTA) methods still struggle to recognize text written in arbitrary shapes. In this paper, we introduce a novel architecture for STR, named Selective Context ATtentional Text Recognizer (SCATTER). SCATTER utilizes a stacked block architecture with intermediate supervision during training, that paves the way to successfully train a deep BiLSTM encoder, thus improving the encoding of contextual dependencies. Decoding is done using a two-step 1D attention mechanism. The first attention step re-weights visual features from a CNN backbone together with contextual features computed by a BiLSTM layer. The second attention step, similar to previous papers, treats the features as a sequence and attends to the intra-sequence relationships. Experiments show that the proposed approach surpasses SOTA performance on irregular text recognition benchmarks by 3.7\% on average.

研究动机与目标

  • 为解决识别任意形状文本(尤其是不规则弯曲或扭曲文本)的挑战,这仍是场景文本识别中的关键瓶颈。
  • 稳定深层 BiLSTM 编码器的训练,因为传统方法在超过两层后通常因梯度消失和优化困难而性能下降。
  • 通过在堆叠架构中引入中间监督,实现预测结果的逐步优化,从而改进场景文本识别中的上下文建模能力。
  • 探索使用多个中间解码器以提升识别性能的潜力,通过在预测结果间实现类似“真值投票”的机制。
  • 证明在深层网络中,通过中间监督重复处理特征可使预测结果逐步变得更加准确。

提出的方法

  • SCATTER 采用堆叠模块架构,其中每个模块通过 CNN 主干网络和 BiLSTM 编码器处理视觉特征,并在每个模块应用中间监督。
  • 中间监督通过辅助解码器实现,为训练提供多个阶段的监督信号,从而稳定深层 BiLSTM 编码器的训练。
  • 选择性解码器采用两步 1D 注意力机制:首先关注视觉特征和 BiLSTM 的上下文特征,然后关注融合特征中的序列内关系。
  • 该架构支持预测结果的逐步优化,每个后续模块均在前一模块的基础上进行改进,如中间解码器准确率逐步提升所示。
  • 该方法支持训练深度编码器(最多 10 层 BiLSTM),准确率单调提升,而先前方法在超过 2 层后性能即开始下降。
  • 该框架可通过中间解码器预测结果的真值投票策略,实现类似集成的性能增益。

实验结果

研究问题

  • RQ1在堆叠模块架构中,中间监督是否能稳定深层 BiLSTM 编码器在场景文本识别中的训练?
  • RQ2一种融合视觉和上下文特征的两步注意力机制是否能提升识别准确率,尤其在不规则文本上?
  • RQ3通过中间监督实现的重复处理是否能导致场景文本识别中预测结果的逐步优化?
  • RQ4使用所提出的堆叠架构与中间监督,能够有效训练的 BiLSTM 编码器最大深度是多少?
  • RQ5一种通过在多个中间解码器预测中选择最佳结果的真值策略,是否能实现超越最终模型的性能增益?

主要发现

  • SCATTER 在不规则文本基准测试中相比最先进方法平均准确率提升 3.7%,在 IC15 和 SVTP 等数据集上取得显著提升。
  • 模型在使用更深的 BiLSTM 编码器时表现出单调递增的准确率,最佳性能出现在 10 层,超过该深度后准确率略有下降。
  • 中间解码器显示出逐步优化的特性,预测结果在连续模块间逐步改善,如表 3 和图 2 所示。
  • 在中间解码器预测结果间进行真值投票,可在某些数据集上实现最高 +5.0 个百分点的准确率提升,表明其在集成推理方面具有强大潜力。
  • 使用更深网络并剪枝后序模块的训练策略,性能优于训练浅层网络,表明该架构具有显著的效率优势。
  • 带有中间监督的堆叠模块架构能够稳定训练深层 BiLSTM 编码器,克服了先前工作中观察到的性能退化问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。