Skip to main content
QUICK REVIEW

[論文レビュー] Recognition of Handwritten Roman Script Using Tesseract Open source OCR Engine

Sandip Rakshit, Subhadip Basu|arXiv (Cornell University)|Mar 30, 2010
Handwritten Text Recognition Techniques被引用数 4
ひとこと要約

この論文は、1人のユーザーから得た1,844文字の分離文字を用いて訓練されたオープンソースOCRエンジンTesseract 2.01の、手書きの小文字ローマンスクリプト認識性能を評価している。テストデータセットの1,133文字に対して、文字単位の正確性は83.5%に達し、文字分離の失敗は5.56%、誤分類は10.94%を記録した。

ABSTRACT

In the present work, we have used Tesseract 2.01 open source Optical Character Recognition (OCR) Engine under Apache License 2.0 for recognition of handwriting samples of lower case Roman script. Handwritten isolated and free-flow text samples were collected from multiple users. Tesseract is trained to recognize user-specific handwriting samples of both the categories of document pages. On a single user model, the system is trained with 1844 isolated handwritten characters and the performance is tested on 1133 characters, taken form the test set. The overall character-level accuracy of the system is observed as 83.5%. The system fails to segment 5.56% characters and erroneously classifies 10.94% characters.

研究の動機と目的

  • オープンソースのTesseract OCRエンジンが手書きローマンスクリプトを認識する性能を評価すること。
  • Tesseractをユーザー固有の手書きサンプルで訓練することで、認識性能の向上が可能かどうかを調査すること。
  • 分離済みおよび自由な流れの手書きテキストサンプルにおける文字分離と分類の正確性を評価すること。
  • 特に文字分離と誤分類率に注目した、文字認識における失敗モードの分析。

提案手法

  • 複数のユーザーから分離済みおよび自由な流れの手書きローマンスクリプトサンプルを収集した。
  • 1,844個の分離された手書き文字を用いて、Tesseract 2.01を1ユーザー分のモデルで訓練した。
  • 未学習データに対する性能評価のため、1,133文字のテストセットを用いた。
  • 文字単位の正確性、分離失敗率、誤分類率を測定した。
  • 標準的なTesseract OCRパイプラインを適用し、特徴抽出と内部のHMMベースモデルを用いた分類を実施した。
  • 分離済みおよび自由な流れのテキストの両カテゴリに対して結果を評価し、耐性を検証した。

実験結果

リサーチクエスチョン

  • RQ1Tesseract 2.01は、ユーザー固有のトレーニングを施した場合、手書きの小文字ローマンスクリプトを効果的に認識できるか?
  • RQ2Tesseractが分離された手書き文字でトレーニングされた場合、文字単位の正確性はどの程度か?
  • RQ3認識プロセスにおいて、正しく分離されないか、誤って分類された文字の割合はどれくらいか?
  • RQ4分離済みと自由な流れの手書きテキストサンプルの間で、性能にどのような差が生じるか?
  • RQ5Tesseractによる手書きローマンスクリプト認識における主な失敗モードは何か?

主な発見

  • テストセットにおいて、システムは全体として83.5%の文字単位の認識正確性を達成した。
  • Tesseractは5.56%の文字を正しく分離できず、手書き文字分離に課題があることを示している。
  • さらに10.94%の文字が誤って分類されており、全体の誤差率に寄与している。
  • 性能は1ユーザー分のモデルで評価されたため、複数ユーザーまたは適応型トレーニングによる改善の余地があると示唆される。
  • Tesseractは手書きローマンスクリプト認識において有効であるが、分離と分類の誤りは依然として顕著な制限要因である。
  • 本研究は、ユーザー固有の適応を施したオープンソースOCRツール(Tesseractなど)を用いた手書きテキスト認識の実現可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。