Skip to main content
QUICK REVIEW

[论文解读] Improving OCR Accuracy on Early Printed Books using Deep Convolutional Networks

Christoph Wick, Christian Reul|arXiv (Cornell University)|Feb 27, 2018
Handwritten Text Recognition Techniques被引用 4
一句话总结

该论文提出一种结合投票机制的CNN-LSTM混合模型,通过利用更深层的网络结构和更大规模的训练数据,在早期印刷书籍的OCR任务中显著提升了识别准确率,将字符错误率(CER)降低至0.5%以下。该方法在错误率降低方面相比标准LSTM-based OCR系统最高提升44%,同时保持了相近的推理速度。

ABSTRACT

This paper proposes a combination of a convolutional and a LSTM network to improve the accuracy of OCR on early printed books. While the standard model of line based OCR uses a single LSTM layer, we utilize a CNN- and Pooling-Layer combination in advance of an LSTM layer. Due to the higher amount of trainable parameters the performance of the network relies on a high amount of training examples to unleash its power. Hereby, the error is reduced by a factor of up to 44%, yielding a CER of 1% and below. To further improve the results we use a voting mechanism to achieve character error rates (CER) below $0.5%$. The runtime of the deep model for training and prediction of a book behaves very similar to a shallow network.

研究动机与目标

  • 降低早期印刷书籍OCR中的字符错误率(CER),此类文本在字体和拼写上具有高度变异性。
  • 克服标准LSTM-based OCR模型对每本书均需大量人工标注的局限性。
  • 在拥有充足训练数据的前提下,通过使用更深的网络结构和更多可训练参数来提升性能。
  • 评估数据规模和投票机制对历史文献OCR中CER降低的影响。
  • 通过GPU加速和多线程技术实现高效训练与推理。

提出的方法

  • 采用CNN-LSTM混合架构,卷积层和池化层位于双向LSTM层之前,用于从行图像中提取空间特征和序列特征。
  • 使用连接时序分类(CTC)损失函数进行模型训练,以实现输入图像与转录文本序列之间的对齐。
  • 采用交叉验证训练方法,训练五个独立模型,以增强预测的鲁棒性与多样性。
  • 采用基于ISRI分析工具的投票机制,在通过最长公共子串对齐后,选择各模型中出现频率最高的字符。
  • 基于TensorFlow实现,支持GPU加速训练与推理,提升吞吐量与可扩展性。
  • 通过批量处理和多线程技术优化训练与预测过程,评估不同线程数量下的性能表现。

实验结果

研究问题

  • RQ1CNN-LSTM混合模型是否能比标准LSTM-based OCR系统更有效地降低早期印刷书籍的CER?
  • RQ2增加标注训练数据量在多大程度上影响深度OCR模型在历史文本上的性能?
  • RQ3在多个训练网络生成的多样化预测结果上应用模型投票机制,能在多大程度上提升OCR准确率?
  • RQ4在拥有足够训练数据的前提下,尽管模型复杂度更高,使用更深的网络结构和更多参数是否能带来更好的性能?
  • RQ5在训练与推理效率方面,该深度模型的运行时间与标准OCR系统相比如何?

主要发现

  • 所提出的CNN-LSTM模型相比标准LSTM-based OCR,CER最高降低44%,在所有三本测试的早期印刷书籍上均实现CER为1%或更低。
  • 引入投票机制后,所有书籍的CER进一步降低至0.5%以下,其中在使用3000条训练样本时,Book 1488的CER最低达到0.37%。
  • 模型的推理速度与标准OCRopus系统相当,由于采用高效的原生C++ CTC解码,每行处理时间仅为其一半。
  • 当使用最多4个CPU线程时,由于卷积运算的并行化,训练时间减少了约40%。
  • 随着训练数据增加,模型性能显著提升:投票后CER从1000条样本时的1.0%降至2000条时的0.66%,并在3000条时进一步降至0.37%。
  • 深度模型性能具备良好的可扩展性与效率,预测时间开销极小,且得益于基于GPU的批量训练,性能增益显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。