Skip to main content
QUICK REVIEW

[论文解读] Rethinking Irregular Scene Text Recognition

Shangbang Long, Yushuo Guan|arXiv (Cornell University)|Aug 30, 2019
Handwritten Text Recognition Techniques参考文献 39被引用 9
一句话总结

本论文通过引入一系列实用技术,重新思考了不规则场景文本识别问题,显著提升了基于校正的模型在弯曲及任意形状文本上的性能。通过利用弯曲合成数据(CurvedSynth)、随机旋转的方形化处理、数据混合策略,以及借助TextSnake等检测器进行图像校正,该方法在CUTE-80上达到89.6%的准确率,在Total-Text上达到76.3%的准确率,分别超越之前最先进方法6.3%和14.7%,并在ICDAR 2019 ArT挑战赛中以74.3%的测试准确率夺冠。

ABSTRACT

Reading text from natural images is challenging due to the great variety in text font, color, size, complex background and etc.. The perspective distortion and non-linear spatial arrangement of characters make it further difficult. While rectification based method is intuitively grounded and has pushed the envelope by far, its potential is far from being well exploited. In this paper, we present a bag of tricks that prove to significantly improve the performance of rectification based method. On curved text dataset, our method achieves an accuracy of 89.6% on CUTE-80 and 76.3% on Total-Text, an improvement over previous state-of-the-art by 6.3% and 14.7% respectively. Furthermore, our combination of tricks helps us win the ICDAR 2019 Arbitrary-Shaped Text Challenge (Latin script), achieving an accuracy of 74.3% on the held-out test set. We release our code as well as data samples for further exploration at https://github.com/Jyouhou/ICDAR2019-ArT-Recognition-Alchemy

研究动机与目标

  • 为解决标准合成数据集(如SynthText和Synth90K)中弯曲文本不足导致的不规则场景文本识别性能差距。
  • 探究数据构成、预处理、模型架构与校正策略对弯曲文本识别的影响。
  • 通过重新评估场景文本识别中常见的深度学习实践,提升模型在任意形状文本上的泛化能力与鲁棒性。
  • 证明即使模型仅在直线文本上进行训练,对输入图像进行校正或基于检测的预处理,也能显著提升识别准确率。

提出的方法

  • 提出CurvedSynth,一种包含丰富弯曲文本实例的合成数据集,用于替代或补充标准直线合成数据,以提升训练效果。
  • 引入带有随机旋转的方形化处理作为预处理技术,以提升模型在弯曲文本上的泛化能力,实现通过旋转进行数据增强。
  • 采用基于校正的识别流程,包含ResNet+FPN主干网络、基于TPS的校正模块(使用多边形控制点)以及基于注意力机制的RNN解码器。
  • 通过使用多种不同数据混合方式与架构训练的多个校正模型的投票集成,提升模型的鲁棒性与准确率。
  • 使用RectTotal,一个通过将TextSnake应用于Total-Text测试图像并结合真实标注多边形生成的新数据集,评估预校正输入的有效性。
  • 实施一种数据混合策略,平衡合成数据与真实世界数据,将真实数据权重设为总训练数据的15%,以提升泛化能力。

实验结果

研究问题

  • RQ1与标准合成数据相比,在包含弯曲文本的合成数据上进行训练,是否能显著提升模型在弯曲文本基准上的识别性能?
  • RQ2带有随机旋转的方形化处理对不规则与弯曲文本识别的模型性能有何影响?
  • RQ3使用预训练检测器(如TextSnake)对输入图像进行校正,能否提升在直线文本上训练的模型在弯曲文本识别上的准确率?
  • RQ4在识别任意形状文本时,合成数据与真实世界数据之间的最优混合比例是多少?
  • RQ5将所有图像统一缩放为固定尺寸(如64×256)的标准预处理方式是否限制了模型在弯曲文本上的性能表现?可变尺寸输入能否带来改进?

主要发现

  • 即使模型结构保持不变,仅将训练数据从SynthText/Synth90K替换为CurvedSynth,CUTE-80上的识别准确率仍提升6.3%,达到89.6%。
  • 在更具挑战性的Total-Text数据集上,该方法实现了76.3%的准确率,相比之前最先进方法提升14.7%。
  • 采用方形化处理、数据混合与投票机制的集成系统,在ICDAR 2019 ArT挑战赛的保留测试集上达到74.3%的准确率,成功夺冠。
  • 通过使用TextSnake与真实标注多边形对测试图像进行预校正,仅在直线文本上训练的模型也能在弯曲文本上达到相近性能,凸显了检测质量的重要性。
  • 带有随机旋转的方形化处理虽在直线文本上提升有限,但显著改善了弯曲文本的识别表现,同时实现了有效的数据增强。
  • 研究揭示,标准预处理方式(固定尺寸缩放)与数据构成方式(如仅使用SynthText)是实现鲁棒弯曲文本识别的主要瓶颈。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。