Skip to main content
QUICK REVIEW

[論文レビュー] Handwritten Urdu Character Recognition using 1-Dimensional BLSTM Classifier

Saad Bin Ahmed, Saeeda Naz|arXiv (Cornell University)|May 15, 2017
Handwritten Text Recognition Techniques参考文献 27被引用数 6
ひとこと要約

本稿では、500人の筆者の自然な筆跡を含む包括的なオフラインデータセット、ウルドゥー・ナスタリーク手書きデータセット(UNHD)を紹介し、1次元双方向LSTM(1D BLSTM)ネットワークを用いた手書きウルドゥー文字認識の手法を提案する。この手法は、連続的な依存関係をモデル化することで、結合文字や変動する筆跡スタイルに起因する課題に対処し、高い精度を達成する。

ABSTRACT

The recognition of cursive script is regarded as a subtle task in optical character recognition due to its varied representation. Every cursive script has different nature and associated challenges. As Urdu is one of cursive language that is derived from Arabic script, thats why it nearly shares the same challenges and difficulties even more harder. We can categorized Urdu and Arabic language on basis of its script they use. Urdu is mostly written in Nastaliq style whereas, Arabic follows Naskh style of writing. This paper presents new and comprehensive Urdu handwritten offline database name Urdu-Nastaliq Handwritten Dataset (UNHD). Currently, there is no standard and comprehensive Urdu handwritten dataset available publicly for researchers. The acquired dataset covers commonly used ligatures that were written by 500 writers with their natural handwriting on A4 size paper. We performed experiments using recurrent neural networks and reported a significant accuracy for handwritten Urdu character recognition.

研究の動機と目的

  • ウルドゥー手書き文字認識のための公開可能で包括的なオフラインデータセットの不足に対処すること。
  • ナスタリーク様式の筆跡と頻発する結合文字による高い可変性を示すカーリーなウルドゥー文字スクリプトに対する耐障害性の高い認識システムの開発。
  • 再帰的ニューラルネットワーク、特に1D BLSTMがカーリーなウルドゥー文字の順序パターンをどのようにモデル化できるかを評価すること。
  • 標準化されたデータセットとディープラーニングアプローチを用いて、ウルドゥー手書きテキスト認識分野における今後の研究のベンチマークを確立すること。

提案手法

  • 著者らは、A4用紙に記載された500人の筆者のサンプルを含む、新しいオフライン手書きデータセット、ウルドゥー・ナスタリーク手書きデータセット(UNHD)を収集した。
  • データセットには一般的に使用される結合文字が含まれており、ナスタリークスクリプトに特徴的な自然な筆跡のばらつきを反映している。
  • 1次元双方向LSTM(1D BLSTM)ネットワークを用いて、カーリー文字の筆跡における順序的依存関係をモデル化した。
  • 1D BLSTMは入力をピクセル行の系列として処理し、画像全体にわたる空間的および文脈的関係を捉える。
  • バックプロパゲーションスルータイムを用いた確率的勾配降下法により、エンドツーエンドでネットワークを訓練した。
  • モデルアーキテクチャは、ウルドゥー文字スクリプトの方向性と接続性を考慮しており、複雑な結合文字の認識を向上させた。

実験結果

リサーチクエスチョン

  • RQ1ナスタリークスクリプトにおける高い可変性にもかかわらず、1D BLSTMモデルは手書きウルドゥー文字を効果的に認識できるか?
  • RQ2大規模で現実世界のウルドゥー手書きデータセット上で、提案された1D BLSTMモデルは従来の手法と比較してどの程度の精度を示すか?
  • RQ3UNHDデータセットに自然な筆跡のばらつきと結合文字を含めることで、モデルの一般化能力はどの程度向上するか?
  • RQ4新たに導入されたUNHDデータセット上で、1D BLSTMモデルの認識精度はどの程度か?

主な発見

  • 提案された1D BLSTMモデルは、UNHDデータセット上で顕著な認識精度を達成し、カーリーなウルドゥー文字において優れた性能を示した。
  • UNHDデータセットの導入により、ウルドゥー手書き文字認識分野における今後の研究の標準化されたベンチマークが提供された。
  • モデルはカーリーなスクリプトにおける順序的依存関係を効果的に捉えており、特に結合・接続された文字の認識に有益であった。
  • 500人の筆者からの自然な筆跡を含む大規模かつ多様なデータセットの活用により、モデルの耐障害性と一般化能力が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。