[论文解读] Recognition of Handwritten Roman Script Using Tesseract Open source OCR Engine
该论文评估了开源OCR引擎Tesseract 2.01在识别手写小写罗马字母文字方面的表现。该系统基于单个用户的1,844个孤立字符进行训练,测试集包含1,133个字符,字符级识别准确率为83.5%,字符分割失败率为5.56%,误分类率为10.94%。
In the present work, we have used Tesseract 2.01 open source Optical Character Recognition (OCR) Engine under Apache License 2.0 for recognition of handwriting samples of lower case Roman script. Handwritten isolated and free-flow text samples were collected from multiple users. Tesseract is trained to recognize user-specific handwriting samples of both the categories of document pages. On a single user model, the system is trained with 1844 isolated handwritten characters and the performance is tested on 1133 characters, taken form the test set. The overall character-level accuracy of the system is observed as 83.5%. The system fails to segment 5.56% characters and erroneously classifies 10.94% characters.
研究动机与目标
- 评估开源Tesseract OCR引擎在识别手写罗马字母文字方面的性能。
- 研究基于用户特定手写样本训练Tesseract以提升识别效果的可行性。
- 评估在孤立字符和自由流动手写文本样本上的分割与分类准确率。
- 分析字符识别中的失败模式,特别是分割和误分类率。
提出的方法
- 从多位用户处收集了孤立和自由流动的手写罗马字母文字样本。
- 使用1,844个孤立手写字符,基于单个用户模型对Tesseract 2.01进行训练。
- 使用包含1,133个字符的测试集评估在未见数据上的性能表现。
- 测量字符级准确率、分割失败率和误分类率。
- 采用标准Tesseract OCR处理流程,结合特征提取与内部基于HMM的模型进行分类。
- 分别在孤立文本和自由流动文本类别上评估结果,以检验系统的鲁棒性。
实验结果
研究问题
- RQ1Tesseract 2.01能否在用户特定训练下有效识别手写小写罗马字母文字?
- RQ2当基于孤立手写字符进行训练时,Tesseract的字符级准确率是多少?
- RQ3识别过程中有多少比例的字符被错误分割或误分类?
- RQ4在孤立与自由流动手写文本样本之间,性能表现有何差异?
- RQ5Tesseract在识别手写罗马字母文字时的主要失败模式是什么?
主要发现
- 系统在测试集上实现了83.5%的整体字符级识别准确率。
- Tesseract有5.56%的字符未能正确分割,表明手写分割存在挑战。
- 另有10.94%的字符被错误分类,是整体错误率的重要组成部分。
- 性能评估基于单个用户模型,表明通过多用户或自适应训练可能进一步提升性能。
- 结果表明,尽管Tesseract在手写罗马字母文字识别方面具有潜力,但分割和分类错误仍是显著限制因素。
- 本研究证明了使用Tesseract等开源OCR工具结合用户特定适配,实现手写文本识别的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。