Skip to main content
QUICK REVIEW

[论文解读] Recognition of handwritten Roman Numerals using Tesseract open source OCR engine

Sandip Rakshit, Amitava Kundu|arXiv (Cornell University)|Mar 30, 2010
Handwritten Text Recognition Techniques参考文献 11被引用 12
一句话总结

本文提出了一种使用Tesseract开源OCR引擎识别手写罗马数字的系统。在来自不同用户的1,226个样本上进行训练后,该系统在已知用户测试数据上的准确率达到92.1%,在未知用户数据上的准确率为86.59%,展示了使用通用OCR引擎结合自定义语言建模,在无需针对特定用户进行训练的情况下,实现稳健的用户无关手写罗马数字识别能力。

ABSTRACT

The objective of the paper is to recognize handwritten samples of Roman numerals using Tesseract open source Optical Character Recognition (OCR) engine. Tesseract is trained with data samples of different persons to generate one user-independent language model, representing the handwritten Roman digit-set. The system is trained with 1226 digit samples collected form the different users. The performance is tested on two different datasets, one consisting of samples collected from the known users (those who prepared the training data samples) and the other consisting of handwritten data samples of unknown users. The overall recognition accuracy is obtained as 92.1% and 86.59% on these test datasets respectively.

研究动机与目标

  • 开发一种基于开源OCR引擎的用户无关手写罗马数字识别系统。
  • 评估Tesseract OCR在已知用户和未知用户数据集上的手写罗马数字识别性能。
  • 利用多样化的手写样本训练语言模型,以提升对不同书写风格的泛化能力。
  • 评估通用OCR引擎在未进行领域特定优化的情况下,对专用手写数字任务的识别效果。

提出的方法

  • 使用从多位用户收集的1,226个手写罗马数字样本对Tesseract OCR引擎进行训练,以构建用户无关的语言模型。
  • 生成自定义语言模型以表示手写罗马数字字符集,使Tesseract能够识别书写风格的差异。
  • 在两个测试数据集上评估系统:一个包含训练时使用过的用户的手写样本,另一个包含此前未见过的用户的手写样本。
  • 通过将Tesseract的输出与各测试集的真实标签进行比较,测量识别准确率。
  • 训练和测试过程充分利用了Tesseract现有的字符识别和语言建模能力,未修改其核心引擎。

实验结果

研究问题

  • RQ1Tesseract OCR能否通过使用用户无关语言模型有效识别手写罗马数字?
  • RQ2当在已知用户与未知用户的数据上测试时,Tesseract的识别准确率有何差异?
  • RQ3在多样化手写样本上进行训练,能在多大程度上提升罗马数字识别的泛化能力?
  • RQ4在未进行领域特定优化的情况下,通用OCR引擎在专用手写数字任务上的表现如何?

主要发现

  • 在参与训练的用户提供的测试数据上,系统识别准确率达到92.1%。
  • 在未知用户的数据上,识别准确率下降至86.59%,表明在面对未见书写风格时性能有所下降。
  • 结果表明,通过使用用户无关语言模型,Tesseract可被有效适配用于手写罗马数字识别。
  • 已知用户与未知用户之间的性能差距凸显了在多样化手写风格间实现泛化所面临的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。