[论文解读] State of the Art Optical Character Recognition of 19th Century Fraktur Scripts using Open Source Engines
本文使用基于多样化真实世界数据的混合模型(而非合成数据)评估了开源OCR引擎在19世纪弗拉赫特尔手写体上的表现。结果表明,新型OCR引擎Calamari显著优于Tesseract和OCRopus,将ABBYY的字符错误率(CER)降低了70%以上,在未见过的历史文本上实现了平均CER低于1%的性能。
In this paper we evaluate Optical Character Recognition (OCR) of 19th century Fraktur scripts without book-specific training using mixed models, i.e. models trained to recognize a variety of fonts and typesets from previously unseen sources. We describe the training process leading to strong mixed OCR models and compare them to freely available models of the popular open source engines OCRopus and Tesseract as well as the commercial state of the art system ABBYY. For evaluation, we use a varied collection of unseen data from books, journals, and a dictionary from the 19th century. The experiments show that training mixed models with real data is superior to training with synthetic data and that the novel OCR engine Calamari outperforms the other engines considerably, on average reducing ABBYYs character error rate (CER) by over 70%, resulting in an average CER below 1%.
研究动机与目标
- 评估开源OCR引擎在未经特定书籍训练的情况下对19世纪弗拉赫特尔手写体的性能表现。
- 探究基于真实历史数据训练的混合模型是否优于基于合成数据训练的模型。
- 将最先进的开源OCR引擎Calamari与Tesseract、OCRopus等成熟引擎以及商业系统ABBYY进行比较。
- 在包括书籍、期刊和词典在内的多样化未见过的历史文献上评估OCR性能。
- 建立仅使用开源工具和真实训练数据的弗拉赫特尔手写体高精度OCR基准。
提出的方法
- 使用来自多个来源的多样化真实19世纪弗拉赫特尔手写体文献集合,训练混合OCR模型。
- 比较基于真实数据与合成数据训练的模型,以评估其泛化能力和鲁棒性。
- 采用开源OCR引擎Calamari,其基于深度学习的序列建模技术可提升字符识别性能。
- 在保留的测试集(包括书籍、期刊和词典)上评估所有模型在未见过的19世纪弗拉赫特尔手写体文本上的表现。
- 以字符错误率(CER)为主要指标,比较不同OCR引擎的性能。
- 应用标准预处理技术(如二值化和降噪)以提升OCR引擎的输入质量。
实验结果
研究问题
- RQ1在真实历史弗拉赫特尔手写体数据上训练混合OCR模型,是否比在合成数据上训练能获得更好的性能?
- RQ2在未见过的19世纪弗拉赫特尔手写体文本上,开源OCR引擎Calamari与Tesseract、OCRopus以及商业ABBYY系统的性能相比如何?
- RQ3在不进行特定书籍微调的情况下,开源OCR引擎能否在19世纪弗拉赫特尔手写体上实现低于1%的字符错误率?
- RQ4训练数据中字体和排版样式的多样性对历史手写体OCR模型泛化能力有何影响?
- RQ5开源工具在识别复杂历史手写体方面,能在多大程度上达到或超越商业OCR系统(如ABBYY)的性能?
主要发现
- 在真实历史弗拉赫特尔手写体数据上训练混合模型,在泛化能力和准确性方面显著优于在合成数据上训练的模型。
- 开源OCR引擎Calamari在未见过的19世纪弗拉赫特尔手写体文本上实现了平均字符错误率(CER)低于1%。
- 在测试集上,Calamari平均将商业ABBYY系统的字符错误率降低了70%以上。
- Calamari在复杂历史手写体上的表现优于Tesseract和OCRopus,展现出更高的鲁棒性和准确性。
- Calamari结合真实数据训练与先进的深度学习架构,实现了弗拉赫特尔手写体OCR的最先进性能。
- 即使不进行特定书籍的微调,表现最佳的开源模型在历史弗拉赫特尔手写体文档上也达到了接近生产级别的准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。