Skip to main content
QUICK REVIEW

[论文解读] Traditional Chinese Synthetic Datasets Verified with Labeled Data for Scene Text Recognition

Yi‐Chang Chen, Yu‐Chuan Chang|arXiv (Cornell University)|Nov 26, 2021
Handwritten Text Recognition Techniques参考文献 13被引用 4
一句话总结

本文提出了一种用于繁体中文场景文字识别(STR)的合成数据生成框架,通过字体、背景和文字属性的多样化变化,生成超过2000万张多样化的合成图像。在新创建的TC-STR 7k词基准上进行评估,使用合成数据预训练并结合少量真实数据微调的模型达到89.64%的准确率,证明了在极少人工标注数据的情况下仍能实现显著的性能提升。

ABSTRACT

Scene text recognition (STR) has been widely studied in academia and industry. Training a text recognition model often requires a large amount of labeled data, but data labeling can be difficult, expensive, or time-consuming, especially for Traditional Chinese text recognition. To the best of our knowledge, public datasets for Traditional Chinese text recognition are lacking. This paper presents a framework for a Traditional Chinese synthetic data engine which aims to improve text recognition model performance. We generated over 20 million synthetic data and collected over 7,000 manually labeled data TC-STR 7k-word as the benchmark. Experimental results show that a text recognition model can achieve much better accuracy either by training from scratch with our generated synthetic data or by further fine-tuning with TC-STR 7k-word.

研究动机与目标

  • 为解决繁体中文场景文字识别(STR)领域缺乏公开且高质量数据集的问题。
  • 开发一种可扩展的合成数据生成框架,以模拟真实世界中的文字多样性,从而低成本、高效率地生成大规模训练数据。
  • 创建一个手动标注的真实世界基准数据集(TC-STR 7k词),用于可靠评估STR模型。
  • 评估合成数据多样性(尤其是背景和字体变化)对模型泛化能力和准确率的影响。
  • 证明在合成数据上进行预训练,随后在有限的真实数据上进行微调,优于仅在真实数据上从零开始训练。

提出的方法

  • 合成数据引擎采用多阶段流水线生成场景文字图像:从精选词典和维基百科标题中采样文字,通过随机插入实现字符间距控制,并使用175种不同字体进行多样化字体渲染。
  • 文字渲染过程引入可变的字体大小、颜色、描边效果、倾斜、形变和噪声,以模拟真实世界中的多样性。
  • 背景包括简单的 solid 颜色和源自真实图像的复杂、多变的背景,以增强真实感和多样性。
  • 模型架构采用TPS变换,ResNet用于特征提取,BiLSTM用于序列建模,CTC用于序列预测。
  • 消融研究分离分析了背景、字体、场景和文字多样性对模型性能的独立贡献。
  • 微调过程使用在合成数据上预训练的模型,并结合真实TC-STR 7k词数据集的一个子集,辅以数据增强技术。

实验结果

研究问题

  • RQ1是否可以通过合成数据生成框架,在仅使用极少真实世界标注数据的情况下,显著提升繁体中文场景文字识别模型的性能?
  • RQ2背景、字体、文字形变和文字多样性等变化如何影响STR模型的泛化能力和准确率?
  • RQ3在合成数据上预训练,随后在真实数据上微调,是否优于仅在真实数据上从零开始训练?
  • RQ4与简单背景相比,在合成数据中引入复杂、多变的自然背景在多大程度上提升了模型的鲁棒性?
  • RQ5合成数据在多大程度上能够减少繁体中文STR任务中对昂贵人工标注的依赖?

主要发现

  • 在2000万张合成图像上预训练,并在TC-STR 7k词数据集的一个子集上进行微调的模型,达到了89.64%的准确率,优于仅在真实数据上从零开始训练的模型。
  • 仅在合成数据上进行预训练的模型在TC-STR-test集上达到了83.51%的准确率,证明了合成图像的质量和真实感。
  • 背景多样性对性能影响最大;仅在简单背景上训练的模型准确率显著偏低。
  • 字体多样性至关重要——仅使用一种字体(思源黑体)会显著降低模型的泛化能力和准确率。
  • 文字多样性也显著影响性能;若移除90%的词典内容,识别准确率明显下降。
  • 微调阶段使用数据增强仅带来微小提升,表明合成数据本身已充分捕捉到必要的多样性,从而减少了对额外增强技术的依赖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。