Skip to main content
QUICK REVIEW

[論文レビュー] AlexU-Word: A New Dataset for Isolated-Word Closed-Vocabulary Offline Arabic Handwriting Recognition

Mohamed E. Hussein, Marwan Torki|arXiv (Cornell University)|Nov 17, 2014
Handwritten Text Recognition Techniques参考文献 5被引用数 3
ひとこと要約

本稿では、アラビア文字のアルファベットのすべての文字形をカバーするように設計された、25,114件のサンプルを含む新しいオフラインアラビア語手書き認識データセット、AlexU-Wordを紹介する。このデータセットは、分離された文字画像を用いたモデルの学習により、文字ベースの認識を可能にし、SIFT特徴量と人工ニューラルネットワーク(ANN)を用いて、最先端の92.16%の単語認識精度を達成した。

ABSTRACT

In this paper, we introduce the first phase of a new dataset for offline Arabic handwriting recognition. The aim is to collect a very large dataset of isolated Arabic words that covers all letters of the alphabet in all possible shapes using a small number of simple words. The end goal is to collect a very large dataset of segmented letter images, which can be used to build and evaluate Arabic handwriting recognition systems that are based on segmented letter recognition. The current version of the dataset contains $25114$ samples of $109$ unique Arabic words that cover all possible shapes of all alphabet letters. The samples were collected from $907$ writers. In its current form, the dataset can be used for the problem of closed-vocabulary word recognition. We evaluated a number of window-based descriptors and classifiers on this task and obtained an accuracy of $92.16\%$ using a SIFT-based descriptor and ANN.

研究の動機と目的

  • アラビア文字のアルファベットのすべての文字形を網羅的にカバーする、大規模で閉鎖語彙の分離語用オフラインアラビア語手書き認識用データセットの構築を目的とする。
  • 単語を個々の文字に分割可能なデータセットを提供することで、耐障害性の高い文字検出器のトレーニングを支援し、文字ベースの認識システムの開発を促進することを目的とする。
  • アラビア語手書き認識の文脈において、グローバル特徴量記述子と分類器の評価を可能にするベンチマークデータセットを提供することを目的とする。
  • 将来的に、より多くの語とアノテート済みの文字レベルの分割を追加することで、モデルの汎化性能を向上させるために、データセットを拡張することを目的とする。
  • 大規模で多様な分離文字のデータセットを活用することで、アラビア語手書き認識のパラダイムを単語レベルから文字レベルの検出へと転換することを目的とする。

提案手法

  • 多様な筆跡スタイルと変化をカバーするため、907人の筆者(男性662名、女性245名;右利き846名、左利き61名)からデータを収集した。
  • 28文字のアラビア文字の4つの形態(初期形、中間形、終り形、孤立形)を網羅的にカバーするため、109の固有のアラビア語語を選定した。
  • 各語が複数の筆者によって複数回書き取られ、合計25,114件のサンプルが得られ、データは学習(15,039件)、検証(5,048件)、テスト(5,027件)に分割された。
  • 分類のため、語画像からグローバル画像記述子(勾配方向のヒストグラム(HOG7)とスケール不変特徴変換(SIFT7))を抽出した。
  • 3つの分類器を評価した:k-近傍法(k-NN)、1層の隠れ層(250ノード、シグモイド活性化関数)を備えた人工ニューラルネットワーク(ANN)、線形カーネルを用いたサポートベクターマシン(SVM)。
  • モデルのトレーニングでは、検証セットを用いたハイパーパramータチューニングを行い、最適なパラメータを選定した。その後、ANNには400イテレーションを用いてテストセットで最終評価を実施した。

実験結果

リサーチクエスチョン

  • RQ1少数の簡単で高カバレッジのアラビア語語を用いることで、オフライン手書き認識データセットにおけるアラビア文字のすべての可能な形態を効果的に表現できるか?
  • RQ2閉鎖語彙設定下で、異なるグローバル画像記述子(HOG7 対 SIFT7)が分離語アラビア語を分類する性能にどのように影響するか?
  • RQ3最適化されたハイパーパramータを用いた場合、k-NN、SVM、ANN分類器の相対的な性能はどの程度か?
  • RQ4個々の文字に分割可能なデータセットを活用することで、どの程度文字ベースの認識パラダイムを実現できるか?
  • RQ5多様で筆者に多様性を持つ分離語アラビア語のデータセットにおいて、SIFT特徴量とANNを用いて、どの程度の単語認識精度を達成できるか?

主な発見

  • SIFT7記述子と人工ニューラルネットワーク(ANN)を組み合わせた場合、92.16%の最高分類精度を達成し、HOG7および他の分類器の組み合わせを上回った。
  • k-NN分類器はSIFT7を用いることで79.73%の精度を達成し、HOG7を用いた67.45%よりも顕著に優れていた。これはSIFTが優れた識別能力を有することを示している。
  • ANN分類器はHOG7を用いると86.67%、SIFT7を用いると92.16%の精度を達成した。非線形モデルがより豊かな特徴表現からより大きな利益を得ていることを示している。
  • SVM分類器はSIFT7を用いることで91.16%の精度を達成し、ANNにわずかに劣ったが、他のすべての組み合わせを上回った。線形カーネルを用いた場合の強い汎化性能を示している。
  • 9つの語クラスが100%の精度で分類された。混同行列は強い対角パターンを示しており、多数のクラス間で高い分離性が確認された。
  • 最も混同されやすい語のペアは、視覚的または発音的に類似した語で、類似した文字形や最小限の綴りの違いを示しており、モデルが微細な差に敏感であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。