[论文解读] A Tool for Facilitating OCR Postediting in Historical Documents
本文提出了一种后处理工具,通过利用语言模型得分和字符串相似性,自动纠正历史文献中常见的OCR错误,针对词汇表外的单词提出替换建议。在一部18世纪文献上的测试显示,该工具纠正了63%的错误,尤其在'f'与's'混淆类错误上表现良好,同时保持了人类审查的透明性。
Optical character recognition (OCR) for historical documents is a complex procedure subject to a unique set of material issues, including inconsistencies in typefaces and low quality scanning. Consequently, even the most sophisticated OCR engines produce errors. This paper reports on a tool built for postediting the output of Tesseract, more specifically for correcting common errors in digitized historical documents. The proposed tool suggests alternatives for word forms not found in a specified vocabulary. The assumed error is replaced by a presumably correct alternative in the post-edition based on the scores of a Language Model (LM). The tool is tested on a chapter of the book An Essay Towards Regulating the Trade and Employing the Poor of this Kingdom (Cary ,1719). As demonstrated below, the tool is successful in correcting a number of common errors. If sometimes unreliable, it is also transparent and subject to human intervention.
研究动机与目标
- 通过自动化纠正常见OCR错误,减少对OCR处理后历史文献的手动后处理工作量。
- 解决因印刷质量退化、古体字形及1800年以前文献中拼写不一致导致的OCR准确性挑战。
- 提供一种透明的、人机协同的系统,基于语言合理性与上下文提出纠正建议。
- 通过最小化OCR误识别带来的噪声,提高数字化历史文献的可靠性和可用性。
- 通过开源、基于语言模型增强的纠正方法,实现可扩展、可重复的历史文献后处理。
提出的方法
- 该工具将不在预定义词汇表中的单词识别为潜在的OCR错误。
- 针对每个无法识别的单词,利用字符串相似性(如Levenshtein距离)生成候选替换词,以寻找合理的替代选项。
- 使用训练好的语言模型评估每个候选词在句子上下文中的语法和词汇合理性得分。
- 将得分最高的候选词作为替换建议,同时保留原始词与建议词以供人工审查。
- 系统以PDF为输入,通过Tesseract OCR提取文本,随后使用bash脚本`ocr_and_postprocess.sh`执行后处理。
- 该工具设计具有可扩展性,未来可集成自动字符误识别检测功能及特定时期的语言模型。
实验结果
研究问题
- RQ1基于语言模型与字符串相似性的系统能否有效纠正历史文献中的常见OCR错误?
- RQ2自动化后处理在多大程度上可减少对OCR处理后的早期现代英语文献的手动校对工作量?
- RQ3利用语言模型得分进行上下文感知的纠正,在区分合理替换与错误替换方面效果如何?
- RQ4当面对模糊或高度不规则的OCR错误时,此类系统的局限性是什么?
- RQ5该工具能否被调整以检测并纠正非单词错误,同时保持人类监督的透明性?
主要发现
- 在一部18世纪文献的测试语料中,该工具纠正了63%的OCR错误,显示出对常见错误类型的强劲表现。
- 66%的行至少包含一次纠正,每行最多有三次纠正,表明错误覆盖范围广泛。
- 该系统成功纠正了'f'与's'字符误识别的常见错误,例如'fuch'→'such'和'faid'→'said'。
- 对于模糊情况如'timeas',系统基于语言模型得分提出'times'作为建议,尽管仍需人工审查,凸显了透明性的重要性。
- 该工具在复杂或罕见词汇(如'fignification')上表现不佳,未进行纠正,且偶有错误替换,如'Deputy-Governor'→'Ex-Governor'。
- 该系统在纠正词首及词内错误方面表现出色,尤其在高频功能词(如'shall')上效果显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。