[论文解读] Learning to Read by Spelling: Towards Unsupervised Text Recognition
本文提出了一种无监督文本识别方法,通过将图像预测的文本字符串与未配对语料库中的统计有效字符串进行对齐,利用对抗性训练隐式学习字符身份,而无需任何图像-文本配对标注。该方法仅使用未对齐的图像和文本字符串,在真实历史书籍扫描数据上实现了96.2%的字符准确率和84.8%的词准确率,展现出强大的泛化能力与对非均匀间距的鲁棒性。
This work presents a method for visual text recognition without using any paired supervisory data. We formulate the text recognition task as one of aligning the conditional distribution of strings predicted from given text images, with lexically valid strings sampled from target corpora. This enables fully automated, and unsupervised learning from just line-level text-images, and unpaired text-string samples, obviating the need for large aligned datasets. We present detailed analysis for various aspects of the proposed method, namely - (1) impact of the length of training sequences on convergence, (2) relation between character frequencies and the order in which they are learnt, (3) generalisation ability of our recognition network to inputs of arbitrary lengths, and (4) impact of varying the text corpus on recognition accuracy. Finally, we demonstrate excellent text recognition accuracy on both synthetically generated text images, and scanned images of real printed books, using no labelled training examples.
研究动机与目标
- 开发一种无需任何图像-文本配对标注的文本识别系统,以克服监督数据收集的高昂成本。
- 探究通过将预测字符串与有效语言统计匹配来正确拼写,是否能隐式实现高精度文本识别。
- 评估该方法在任意长度输入及不同语料库(包括与图像内容无关的领域,如《战争与和平》)下的泛化能力。
- 在真实世界、具有挑战性的数据(如具有非均匀间距和可变字体宽度的历史印刷书籍)上展示鲁棒性能。
提出的方法
- 该方法将文本识别建模为将图像预测字符串的条件分布与目标语料库中采样的有效字符串分布对齐,采用对抗性训练。
- 一个全卷积网络从输入图像中预测字符序列,而判别器则确保预测字符串匹配真实语言的统计特性(例如n-gram、频率)。
- 模型采用类似GAN的损失函数进行端到端训练,其中生成器(识别网络)通过生成判别器无法与真实有效文本区分的字符串来不断提升性能。
- 为处理真实扫描书籍中的非均匀间距和可变宽度字体,识别网络最后一层添加了跳跃RNN,为卷积特征提供残差更新。
- 训练过程仅使用未对齐的数据:图像行对与来自语料库的独立未配对文本字符串,无需对齐或人工标注。
- 字符身份通过语言约束隐式学习,高频字符先被学习,低频字符(如'z')最后被学习。
实验结果
研究问题
- RQ1是否仅依赖有效文本的统计特性,即可在无需任何图像-文本配对训练数据的情况下实现文本识别?
- RQ2训练序列长度如何影响收敛速度与识别性能?
- RQ3语料库中字符的频率是否影响字符学习的顺序与质量?
- RQ4在仅使用特定长度序列(如24字符)进行训练的模型,能否泛化到显著不同长度的输入?
- RQ5语料库的选择(尤其是与图像内容无关的语料)如何影响识别准确率?
主要发现
- 在仅使用未对齐图像和文本数据进行训练后,该模型在合成文本图像上实现了99%的字符准确率和95%的词准确率。
- 在具有非均匀间距的真实书籍扫描图像上,加入跳跃RNN的模型将词准确率从45.0%提升至84.8%,字符准确率从85.6%提升至96.2%。
- 字符学习顺序与字符频率强相关:常见词如'to'和'it'被早期学习,而稀有字符如'v'和'w'则被后期学习。
- 该模型对任意长度输入具有良好的泛化能力,在3至48个字符的序列上均保持高性能,即使仅在24字符序列上进行训练。
- 使用与图像内容无关的语料库(如托尔斯泰的《战争与和平》)会使词准确率降至92.53%,但使用相关语料库(如WMT新闻语料)可维持接近最优的性能(约95%)。
- 混淆矩阵显示,仅低频字符如'z'存在持续误分类,表明即使在无监督设置下,稀有字符仍是主要挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。