Skip to main content
QUICK REVIEW

[论文解读] Upcycle Your OCR: Reusing OCRs for Post-OCR Text Correction in Romanised Sanskrit

Amrith Krishna, Bodhisattwa Prasad Majumder|arXiv (Cornell University)|Sep 6, 2018
Natural Language Processing Techniques参考文献 32被引用 4
一句话总结

本文提出了一种用于罗马化梵文的后OCR文本校正模型,通过在预训练OCR系统的基础上应用带有复制机制的序列到序列模型(CopyNet)来纠正OCR错误。该模型在字符识别率(CRR)上比先前最先进模型高出7.69%,并将OCR输出的CRR从35.76%提升至87.01%,人工评估显示该模型能实现更快、更准确的校正。

ABSTRACT

We propose a post-OCR text correction approach for digitising texts in Romanised Sanskrit. Owing to the lack of resources our approach uses OCR models trained for other languages written in Roman. Currently, there exists no dataset available for Romanised Sanskrit OCR. So, we bootstrap a dataset of 430 images, scanned in two different settings and their corresponding ground truth. For training, we synthetically generate training images for both the settings. We find that the use of copying mechanism (Gu et al., 2016) yields a percentage increase of 7.69 in Character Recognition Rate (CRR) than the current state of the art model in solving monotone sequence-to-sequence tasks (Schnober et al., 2016). We find that our system is robust in combating OCR-prone errors, as it obtains a CRR of 87.01% from an OCR output with CRR of 35.76% for one of the dataset settings. A human judgment survey performed on the models shows that our proposed model results in predictions which are faster to comprehend and faster to improve for a human than the other systems.

研究动机与目标

  • 为解决罗马化梵文缺乏可用数据集和OCR系统的问题,提出一种复用其他罗马字母语言训练的现有OCR模型的后OCR校正框架。
  • 提升罗马化梵文文本OCR输出的鲁棒性和准确性,此类文本常因扫描质量差和文字特有挑战导致高错误率。
  • 评估带有复制机制的序列到序列模型是否能在低资源语言(如梵文)的单调序列校正任务中优于传统序列标注模型。
  • 证明通过真实失真模拟生成的合成数据可有效训练模型进行真实世界OCR错误校正,而无需大规模标注数据集。
  • 通过人工评估验证模型的实际效用,测量人工标注者对模型预测结果的校正速度与准确度。

提出的方法

  • 所提出的模型采用带有注意力机制和复制机制(CopyNet)的序列到序列架构,用于校正未分词的罗马化梵文文本中的OCR错误。
  • 使用数字化的梵文文本生成合成训练图像,并施加受控失真(如噪声、模糊、腐蚀),以模拟来自两种不同场景的真实扫描变化。
  • 模型在模拟扫描手稿视觉特征的合成数据上进行训练,包括DPI、对比度和文本行质量的变化。
  • 复制机制使模型能够保留输入OCR输出中的正确字符,减少因外观相似的音位符号误识别导致的错误。
  • 模型在两个真实测试集上进行评估:一个来自高质量扫描,另一个来自低质量扫描(60 DPI),以模拟在恶劣条件下的OCR鲁棒性。
  • 一项人工评估研究比较了OCR输出、基于CRF的模型(PCRF)和所提出的CopyNet模型在45个测试字符串的匿名预测结果上的校正速度与准确度。

实验结果

研究问题

  • RQ1带有复制机制的序列到序列模型是否能在罗马化梵文OCR错误校正任务中优于传统序列标注模型?
  • RQ2通过真实失真模拟生成的合成数据在多大程度上能提升低资源语言后OCR校正模型的鲁棒性?
  • RQ3在罗马化梵文文本的低质量扫描上,所提出的模型与商业OCR系统(如Google Cloud Vision)相比表现如何?
  • RQ4所提出的模型是否产生比基线系统更易理解、更易人工校正的输出?
  • RQ5该模型是否能在无需微调的情况下泛化至不同手稿风格和OCR质量水平?

主要发现

  • 所提出的CopyNet模型在罗马化梵文后OCR校正任务中,字符识别率(CRR)比先前最先进模型(Schnober et al., 2016)高出7.69%。
  • 在低质量扫描设置(60 DPI)下,模型将初始CRR为35.76%的OCR输出提升至87.01%,显示出对OCR错误的强大鲁棒性。
  • 在人工评估中,参与者平均能正确校正4.44/5个句子来自CopyNet预测,而PCRF模型为3.56,原始OCR输出为3.11。
  • CopyNet的校正时间显著更短(每条字符串81.4秒),优于PCRF(106.6秒)和OCR(127.6秒),表明其更高的可用性。
  • 在使用10种随机噪声配置的泛化设置下,模型达到89.02%的CRR,与在精选测试集上报告的89.65% CRR非常接近。
  • 即使在OCR输出CRR极低(低至36%)的情况下,模型仍表现出色,表明其对严重OCR退化具有强鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。