Skip to main content
QUICK REVIEW

[论文解读] Lights, Camera, Action! A Framework to Improve NLP Accuracy over OCR documents

Amit Gupte, Alexey Romanov|arXiv (Cornell University)|Aug 6, 2021
Topic Modeling参考文献 25被引用 4
一句话总结

本文提出了一种框架,通过合成数据生成管道(Genalog)和基于动作预测的文本恢复模型,提升经OCR处理文档的NLP准确率。该方法通过从OCR错误中恢复清晰文本,显著减少了命名实体识别(NER)准确率的下降——最高实现73%的误差差距缩减,即使在分布外数据上也具备泛化能力。

ABSTRACT

Document digitization is essential for the digital transformation of our societies, yet a crucial step in the process, Optical Character Recognition (OCR), is still not perfect. Even commercial OCR systems can produce questionable output depending on the fidelity of the scanned documents. In this paper, we demonstrate an effective framework for mitigating OCR errors for any downstream NLP task, using Named Entity Recognition (NER) as an example. We first address the data scarcity problem for model training by constructing a document synthesis pipeline, generating realistic but degraded data with NER labels. We measure the NER accuracy drop at various degradation levels and show that a text restoration model, trained on the degraded data, significantly closes the NER accuracy gaps caused by OCR errors, including on an out-of-domain dataset. For the benefit of the community, we have made the document synthesis pipeline available as an open-source project.

研究动机与目标

  • 通过生成保留NER标注的合成、逼真OCR影响文档,解决用于训练NLP模型的标注过的退化OCR文档稀缺问题。
  • 减轻OCR错误对下游NLP任务的负面影响,特别是命名实体识别(NER),该任务因文本退化而出现准确率下降。
  • 开发一种可泛化的文本恢复模型,从OCR输出中重建清晰文本,提升下游NER性能,且无需依赖任务特定的微调。
  • 在不同OCR退化程度和分布外数据集上评估框架的有效性,以检验其鲁棒性和泛化能力。
  • 将合成文档生成管道(Genalog)公开为开源,以支持未来在文档智能和OCR错误缓解方面的研究。

提出的方法

  • 设计并实现Genalog,该管道从纯文本生成合成文档图像,应用逼真的OCR退化(如模糊、噪声、油墨渗透),对图像运行OCR,并将原始文本中的NER标注传播至OCR输出。
  • 训练一个序列到序列的动作预测模型,通过在词元级别预测更正动作(如插入、删除、替换)来学习将噪声OCR文本映射为清晰文本。
  • 使用多任务Bi-LSTM模型进行NER,该模型在词元和字符级别同时运行,以增强对OCR引入的子词级错误的鲁棒性。
  • 使用动态规划对齐清晰文本与噪声文本对,以在模型训练期间保持标签一致性。
  • 在将文本输入NER模型前,应用动作预测模型对OCR输出进行恢复,实现端到端的错误纠正。
  • 使用多个数据集(CoNLL-2003、CoNLL-2012、CNN)和不同退化程度评估框架,测量NER性能的F1分数提升。

实验结果

研究问题

  • RQ1在不同文档质量水平下,OCR退化对NER性能的影响程度如何?
  • RQ2在合成退化OCR数据上训练的文本恢复模型,能否有效恢复真实世界OCR输出的NER准确率?
  • RQ3动作预测模型在训练期间未见过的分布外文档上泛化能力如何?
  • RQ4在不同退化强度下,使用恢复文本与原始OCR输出相比,NER F1分数的相对提升如何?
  • RQ5在处理由OCR错误引起的对齐不匹配时,动作预测方法是否优于传统seq2seq模型?

主要发现

  • OCR退化导致显著的NER准确率下降,CoNLL-2003清晰文本的F1分数从0.860降至噪声文本的0.820,下降4.6个百分点。
  • 在轻度退化条件下,动作预测模型在CoNLL-2012上可恢复73%的NER准确率差距,在CoNLL-2003上可恢复52%,表明在标准数据集上表现强劲。
  • 在CNN数据集上(该数据集无人工标注的NER标签,使用模型生成的真实标签),噪声文本的NER F1分数从0.989降至0.590,而恢复模型恢复了76%的准确率差距。
  • 模型在中等退化水平下表现最佳,对幻觉退化和所有退化(轻度)设置的准确率差距缩减最高达77%,但在重度复合退化下性能略有下降。
  • 在最严重的退化设置(所有退化处于重度模式)下,动作预测方法将NER准确率差距减少了19%,表明即使在极端OCR噪声下也具备鲁棒性。
  • 该框架能有效泛化至分布外数据,恢复模型在未微调过的CNN文章上也提升了NER性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。