Skip to main content
QUICK REVIEW

[論文レビュー] Omnifont Persian OCR System Using Primitives

Azarakhsh Keipour, Mohammad Eshghi|arXiv (Cornell University)|Feb 13, 2022
Handwritten Text Recognition Techniques被引用数 5
ひとこと要約

この論文では、多様なフォントとサイズで文字を認識できるモデルベースのオムニフォントペルシャ語OCRシステムを提示している。8つの基本的構造的要素を用いることで、テキスト行の分離、ストローク抽出、プリミティブの特定を同時に処理し、14種の標準ペルシャ語フォント、6種のサイズで97.06%の精度を達成した。独立したセグメンテーション手順による誤差伝播を回避した。

ABSTRACT

In this paper, we introduce a model-based omnifont Persian OCR system. The system uses a set of 8 primitive elements as structural features for recognition. First, the scanned document is preprocessed. After normalizing the preprocessed image, text rows and sub-words are separated and then thinned. After recognition of dots in sub-words, strokes are extracted and primitive elements of each sub-word are recognized using the strokes. Finally, the primitives are compared with a predefined set of character identification vectors in order to identify sub-word characters. The separation and recognition steps of the system are concurrent, eliminating unavoidable errors of independent separation of letters. The system has been tested on documents with 14 standard Persian fonts in 6 sizes. The achieved precision is 97.06%.

研究の動機と目的

  • フォントに依存しない、耐障害性の高いペルシャ語テキスト用OCRシステムの開発。フォントスタイルやサイズの変化に対応する。
  • フォント固有の学習に依存する従来のOCRシステムの限界を克服すること。
  • 独立したセグメンテーション手順による誤差蓄積を低減するため、テキスト行分離と文字認識を一度のプロセスで統合すること。
  • ペルシャ文字の普遍的認識フレームワークを、最小限の構造的プリミティブで構築すること。
  • 多様な標準ペルシャ語フォントと複数のフォントサイズで、システムの性能を評価すること。

提案手法

  • 画像品質の正規化とコントラスト強化により、スキャン済みドキュメントを事前処理する。
  • 幾何学的・レイアウト解析を用いてテキスト行とサブワードに分離し、その後スケルトン化によりストローク骨格を抽出する。
  • サブワード内にドット(イ'rāb記号)を検出・局所化し、正確な文字セグメンテーションを支援する。
  • スケルトン化されたサブワードからストローク特徴を抽出し、8つの事前に定義されたプリミティブ要素のいずれかに分類する。
  • 各サブワードのプリミティブ要素の集合を、事前に定義された文字識別ベクトルと照合して認識する。
  • 誤差伝播を避けるために、認識と分離を並列的に処理する。

実験結果

リサーチクエスチョン

  • RQ1最小限の構造的プリミティブセットが、多様なフォントとサイズでペルシャ文字の正確な認識を可能にするか?
  • RQ2並列処理による同時分離と認識は、逐次処理と比較してOCR精度をどのように向上させるか?
  • RQ3本システムの性能は、広範な標準ペルシャ語フォントとフォントサイズでどの程度か?
  • RQ4プリミティブベースの特徴は、フォント固有の学習データへの依存度をどの程度低減するか?
  • RQ5ストロークベースのプリミティブは、文字形状やストロークの複雑さの変化に対し、どの程度効果的に機能するか?

主な発見

  • 本システムは、14種の標準ペルシャ語フォントと6種の異なるサイズを含むスキャン済みドキュメントで97.06%の精度を達成した。
  • テキスト行分離と文字認識を同時に処理することで、独立したセグメンテーションと比較して誤差伝播が顕著に低減された。
  • 8つのプリミティブ構造的要素の使用により、フォント固有のモデルを必要とせずに、多様なフォントスタイルで堅牢な認識が可能になった。
  • 本システムは、構造的認識アプローチを採用しているため、未学習のフォント・サイズの組み合わせに対しても優れた汎化能力を示した。
  • ドット検出とストローク抽出は、複雑なペルシャ文字形における正確なサブワードセグメンテーションとプリミティブ分類に不可欠である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。