Skip to main content
QUICK REVIEW

[论文解读] Why You Should Try the Real Data for the Scene Text Recognition

Vladimir Loginov|arXiv (Cornell University)|Jul 29, 2021
Handwritten Text Recognition Techniques参考文献 26被引用 4
一句话总结

本论文表明,与仅依赖合成数据相比,在真实世界数据集(如 OpenImages V5)上训练场景文本识别模型可取得更优性能,在多个基准测试中达到最先进水平。通过利用多样化、具有挑战性的真实数据,结合基于 YAMTS 的架构并减少数据增强,作者在 IC15 和 SVT-P 等数据集上实现的准确率高于以往最先进模型。

ABSTRACT

Recent works in the text recognition area have pushed forward the recognition results to the new horizons. But for a long time a lack of large human-labeled natural text recognition datasets has been forcing researchers to use synthetic data for training text recognition models. Even though synthetic datasets are very large (MJSynth and SynthTest, two most famous synthetic datasets, have several million images each), their diversity could be insufficient, compared to natural datasets like ICDAR and others. Fortunately, the recently released text-recognition annotation for OpenImages V5 dataset has comparable with synthetic dataset number of instances and more diverse examples. We have used this annotation with a Text Recognition head architecture from the Yet Another Mask Text Spotter and got comparable to the SOTA results. On some datasets we have even outperformed previous SOTA models. In this paper we also introduce a text recognition model. The model's code is available.

研究动机与目标

  • 探究在真实世界自然场景文本数据集上训练是否能优于传统的合成数据训练方法。
  • 解决由于合成训练数据与真实测试数据之间分布差异导致的领域偏移问题。
  • 证明在使用真实数据时减少数据增强可使模型更好地学习有意义的特征,从而提升泛化能力。
  • 鼓励研究社区采用真实数据进行训练,尤其是针对基于注意力机制和 Transformer 的模型。
  • 提出一种新型文本识别模型,通过使用真实数据在多个基准测试中实现最先进性能。

提出的方法

  • 使用包含超过 100 万张真实世界人工标注场景文本图像的 OpenImages V5 数据集训练文本识别模型。
  • 采用基于 YAMTS 的架构,结合 TPS 进行几何变换,以 ResNeXt-101 作为主干网络,并使用 2D 注意力机制的序列建模头。
  • 采用大小写不敏感的训练与评估方式,以提升泛化能力,尤其是在训练复杂真实数据时。
  • 对比使用合成数据(MJSynth、SynthText)、真实数据(OpenImages V5)以及混合组合的数据训练方式,评估性能权衡。
  • 通过消融实验比较大小写敏感与大小写不敏感训练方式,并评估数据多样性对模型容量的影响。
  • 使用混合数据(MJSynth、SynthText、OpenImages V5)训练 ViTSTR-Tiny 模型,以评估模型在强增强条件下利用真实数据的能力。

实验结果

研究问题

  • RQ1在真实世界自然场景文本数据上训练是否能提升识别准确率,相比仅使用合成数据?
  • RQ2在真实数据上训练时减少数据增强是否能带来更好的泛化能力与真实测试集上的更高性能?
  • RQ3基于注意力机制和 Transformer 的模型在真实数据与合成数据上训练时,性能表现有何差异?
  • RQ4在使用更复杂的真实世界数据时,大小写敏感与大小写不敏感训练的影响是什么?
  • RQ5模型在真实数据上训练是否能在不依赖大量数据增强的情况下实现最先进性能?

主要发现

  • 仅使用 OpenImages V5 训练在 IC03 上达到 94.1% 的准确率,在 IC13 上为 94.2%,在 IC15 上为 73.2%,优于仅使用合成数据训练的结果。
  • 使用 MJSynth 与 OpenImages V5 的混合数据将准确率提升至 IC03 的 95.6%、IC13 的 95.2% 和 IC15 的 75.3%,表明结合不同数据源具有显著优势。
  • 在 OpenImages V5 上采用大小写不敏感训练使性能提升至 IC03 的 97.0%、IC13 的 96.5% 和 SVT-P 的 91.6%,在多个基准上超越了以往最先进模型。
  • ViTSTR-Tiny 模型使用 20% 的 OpenImages V5 数据训练,在 IC03 上达到 95.6% 的准确率,在 IC13 上达到 94.2%,表明即使在强增强条件下,真实数据也能增强模型容量。
  • 在更具挑战性的数据集如 IC15 和 SVT-P 上,使用真实数据带来的准确率增益更为显著,表明真实数据更能捕捉领域复杂性。
  • 作者提出的模型在 IC15(准确率 89.9%)和 SVT-P(准确率 91.6%)上均达到最先进水平,优于此前最先进模型在这些基准上的表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。