[论文解读] Leveraging Text Repetitions and Denoising Autoencoders in OCR Post-correction
本文提出了一种新颖的OCR后处理校正方法,利用大规模OCR语料中的文本重复来估计真实的错误分布,从而在无需人工标注的情况下生成合成训练数据。通过在该真实噪声上训练字符级序列到序列模型,该方法显著优于均匀噪声基线,并接近黄金标准性能,相较于原始OCR系统将WER降低了12.38个百分点。
A common approach for improving OCR quality is a post-processing step based on models correcting misdetected characters and tokens. These models are typically trained on aligned pairs of OCR read text and their manually corrected counterparts. In this paper we show that the requirement of manually corrected training data can be alleviated by estimating the OCR errors from repeating text spans found in large OCR read text corpora and generating synthetic training examples following this error distribution. We use the generated data for training a character-level neural seq2seq model and evaluate the performance of the suggested model on a manually corrected corpus of Finnish newspapers mostly from the 19th century. The results show that a clear improvement over the underlying OCR system as well as previously suggested models utilizing uniformly generated noise can be achieved.
研究动机与目标
- 通过从大规模文本重复中估计真实OCR错误模式,减少对昂贵的人工校对OCR训练数据的依赖。
- 开发一种合成数据生成方法,利用从对齐重复文本片段中推导出的字符级替换分布,模拟实际OCR错误。
- 在该合成数据上训练神经序列到序列模型,并与均匀噪声和黄金标准基线进行性能评估。
- 探究在目标数据具有相似语言风格和时间周期的语料中进行训练数据构建是否对模型性能至关重要。
- 探索将该方法扩展以处理复杂OCR错误(如一对多字符替换)的可行性。
提出的方法
- 在大规模OCR处理的报纸语料中识别文本重复,并在字符级别对齐,以估计错误模式。
- 从重复片段之间的差异中计算字符替换分布,捕捉系统性OCR错误,如's' → 'f' 或 'b' → 'd'。
- 通过将这些经验推导出的错误分布应用于平行语料库(Gutenberg和Kotus)中的干净文本,生成合成训练数据。
- 训练一个字符级序列到序列神经模型,以对人工污染的文本进行去噪,学习纠正OCR错误。
- 在保留的测试集(手动校对的芬兰报纸文本)上,使用字符错误率(CER)和词错误率(WER)评估模型性能。
- 将该方法与使用均匀生成噪声训练的模型以及在人工校对数据上训练的黄金标准模型进行比较。
实验结果
研究问题
- RQ1能否利用大规模OCR语料中的文本重复可靠估计OCR系统的实际错误分布?
- RQ2在基于经验推导错误分布生成的合成数据上训练去噪自编码器,是否优于使用均匀生成噪声的训练?
- RQ3当目标数据来自相同时间周期但不同体裁时,选择干净预训练语料库(如Gutenberg与Kotus)如何影响模型性能?
- RQ4在重复文本生成的合成数据上训练的模型,其性能是否可接近在黄金标准人工校对数据上训练的模型?
- RQ5当前合成数据生成在捕捉复杂OCR错误(如一对多字符替换)方面存在哪些局限性?
主要发现
- 在使用真实错误分布的合成数据上训练的模型(GUT-REAL)达到23.24%的词错误率(WER),显著优于均匀噪声基线(GUT-UNI,25.35% WER)。
- 在Kotus语料生成的合成数据上训练的模型(KOT-REAL)达到23.45%的WER,表明语料体裁相似性不如时间与语言一致性重要。
- 黄金标准模型将WER降低至16.76%,相较于原始OCR系统(29.14% WER)降低了12.38个百分点,凸显了合成数据与人工数据之间的差距。
- 在完整句子上应用时,基于Gutenberg生成的合成数据训练的模型相较于原始OCR在WER上改善了6.17个百分点,表明其具备上下文感知校正潜力。
- 在黄金标准数据上训练的模型在完整句子上的表现较差(WER降低23.40个百分点),表明更大上下文需要显著更多的数据或架构调整。
- 研究结论认为,基于文本重复的错误估计可实现高质量合成数据生成,从而显著降低对人工标注的依赖,使有效的OCR后处理校正不再必需人工标注。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。