Skip to main content
QUICK REVIEW

[論文レビュー] Handwritten and Machine printed OCR for Geez Numbers Using Artificial Neural Network

Eyob Gebretinsae Beyene|arXiv (Cornell University)|Nov 15, 2019
Handwritten Text Recognition Techniques被引用数 6
ひとこと要約

本研究では、560枚の画像(訓練用460枚、テスト用100枚)を用いて、オフラインでの手書きおよび機械印刷体ゲズ数字の認識を目的としたフィードフォワードバックプロパゲーション型人工ニューラルネットワークを提案する。全体の分類精度は89.88%に達し、宗教的・暦的文書でよく使われるが、従来のエチオピア文字研究では軽視されがちなゲズ数字の認識に関する空白を埋め、エチオピアの歴史的文書のデジタル化に貢献する。

ABSTRACT

Researches have been done on Ethiopic scripts. However studies excluded the Geez numbers from the studies because of different reasons. This paper presents offline handwritten and machine printed Geez number recognition using feed forward back propagation artificial neural network. On this study, different Geez image characters were collected from google image search and three persons are instructed to write the numbers using pencil. In total we have collected 560 numbers of characters. We have used 460 of the characters for training and 100 are used for testing. Accordingly we have achieved overall all classification ~89:88%

研究の動機と目的

  • エチオピアの宗教的・歴史的文書に広く用いられるが、従来のエチオピア文字研究では軽視されがちなゲズ数字認識に関する研究の不足を解消すること。
  • 手書きおよび機械印刷体のゲズ数字を両方認識できる機械学習ベースのシステムの開発。
  • ゲズ数字をデジタルテキストに正確に変換することで、エチオピアの歴史的文書のデジタル化を促進すること。
  • 未だ研究が不足しているアフリカ言語における書記法固有の数字認識に、人工ニューラルネットワークを適用する可能性を検討すること。

提案手法

  • グーグルイメージズ、聖書資料、および3名の個人から得た手書きサンプルから、合計560枚のゲズ数字画像を収集。
  • グレースケールに変換し、二値化し、前景の文字ピクセルを'1'とするために反転処理を施し、個々の文字を分離するなど、画像前処理を実施。
  • ニューラルネットワークへの一貫した入力のため、分離済みの文字を均一な45×40ピクセルのサイズにリサイズ。
  • 3層の隠れ層(20、15、10ニューロン)と、20個のゲズ数字記号を表す20ニューロンの出力層を備えた、マルチレイヤーのフィードフォワードバックプロパゲーション型ニューラルネットワークを設計。
  • 共役勾配バックプロパゲーションを用い、ポラック=リビエール更新法を適用してネットワークを学習。入力ベクトルは、45×40の画像行列を1800要素の列ベクトルにフラット化して作成。
  • 各数字を一意のバイナリベクトルにマッピングできるように、出力ラベルを5ビットバイナリエンコーディングで表現。

実験結果

リサーチクエスチョン

  • RQ1フィードフォワードバックプロパゲーション型ニューラルネットワークは、手書きおよび機械印刷体のゲズ数字を効果的に認識できるか?
  • RQ2ゲズ数字認識において、訓練データとテストデータの間でニューラルネットワークの性能はどのように変動するか?
  • RQ3画像前処理および分離処理のステップが、ゲズ数字認識の精度向上にどの程度寄与するか?
  • RQ4限定的な訓練データサイズが、モデル全体の分類性能に及ぼす影響は何か?
  • RQ5アムハラ語/ゲズ文字のスクリプトで事前学習された既存のニューラルネットワークアーキテクチャを、受け入れ可能な精度でゲズ数字認識に適応可能か?

主な発見

  • 提案されたシステムの全体的な分類精度は、100枚のテスト画像全体で89.88%に達した。
  • 訓練時の分類精度は98.03%と高く、訓練データに対する強い学習能力を示した。
  • テスト時の精度は65.3%にとどまり、訓練性能に比べて顕著な低下が見られた。これは、データの不均衡やテストセットのサイズが小さいことが原因である可能性が高い。
  • モデルは訓練データに対して高い一般化能力を示したが、未知のテストサンプルでは困難を示しており、データ不足が主な制約要因であることが浮き彫りになった。
  • 二値化、反転、リサイズといった画像前処理ステップは、一貫した入力表現を確保し、ネットワーク性能の向上に不可欠であった。
  • 出力ラベルに5ビットバイナリエンコーディングを用いることで、20種類の異なるゲズ数字記号の効果的な多クラス分類が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。