Skip to main content
QUICK REVIEW

[論文レビュー] Implicit segmentation of Kannada characters in offline handwriting recognition using hidden Markov models

Manasij Venkatesh, Vikas Majjagi|arXiv (Cornell University)|Oct 16, 2014
Handwritten Text Recognition Techniques参考文献 12被引用数 4
ひとこと要約

本稿では、連続密度HMMを用いた非明示的セグメンテーション手法を提案し、アグリューティブな性質を活用して複雑な文字を基本形状に分解することで、オフライン・カンナダ手書き文字認識のためのアプローチを提示する。HMMを用いて文字列をモデル化することで、明示的セグメンテーションを回避し、分類の複雑さを低減し、独立した文字分類と比較して10%の精度向上を達成した。Chars74kデータセットでは61.0%の精度を記録し、追加の訓練データを用いることでさらに4%の向上が得られた。

ABSTRACT

We describe a method for classification of handwritten Kannada characters using Hidden Markov Models (HMMs). Kannada script is agglutinative, where simple shapes are concatenated horizontally to form a character. This results in a large number of characters making the task of classification difficult. Character segmentation plays a significant role in reducing the number of classes. Explicit segmentation techniques suffer when overlapping shapes are present, which is common in the case of handwritten text. We use HMMs to take advantage of the agglutinative nature of Kannada script, which allows us to perform implicit segmentation of characters along with recognition. All the experiments are performed on the Chars74k dataset that consists of 657 handwritten characters collected across multiple users. Gradient-based features are extracted from individual characters and are used to train character HMMs. The use of implicit segmentation technique at the character level resulted in an improvement of around 10%. This system also outperformed an existing system tested on the same dataset by around 16%. Analysis based on learning curves showed that increasing the training data could result in better accuracy. Accordingly, we collected additional data and obtained an improvement of 4% with 6 additional samples.

研究の動機と目的

  • 形態的に関連する文字の数が多いことによる分類の複雑さの高い問題に対処すること。
  • オフライン手書き認識における明示的セグメンテーションの限界を克服し、HMMモデリングによる非明示的セグメンテーションを可能にすること。
  • カンナダ文字のアグリューティブ構造を活用することで、有効な訓練サンプルを増加させ、認識精度を向上させること。
  • 訓練データサイズのモデル性能への影響を評価し、学習曲線を通じてデータ効率を示すこと。
  • 低リソースのインディック文字であるカンナダ文字のオフラインHWRのためのベースラインを確立し、堅牢な特徴量とモデルフレームワークを構築すること。

提案手法

  • 固定幅の垂直ストリップに沿ってスライディングウインドウを用い、勾配に基づく特徴量を抽出することで、順序付き観測ベクトルを生成する。
  • 共有状態パラメータを用いた左から右への連続密度HMMを採用し、文字列をモデル化することで、統合的なトレーニングとセグメンテーションを可能にする。
  • 10状態HMMアーキテクチャを採用することで、15状態モデルと比較してモデルの複雑さを低減し、トレーニング効率を向上させる。
  • 観測密度推定にガウス・ミックスチャネル(GMM)を用い、検証精度を最適化することで成分数を最適化する。
  • トレーニングデータにセグメンテーション境界を必要とせず、HMMが潜在的な基本形状(例:子音とモディファイア)を発見できるようにすることで、非明示的セグメンテーションを実現する。
  • 1つの文字に対して6つの追加サンプルを収集することでデータ拡張を実施し、モデルを再トレーニングしてデータの影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1HMMを用いた非明示的セグメンテーションは、異なる文字クラスの数を減らすことで、オフライン・カンナダ手書き認識における認識精度を向上させることができるか?
  • RQ2HMMベースのモデリングによるカンナダ文字のアグリューティブ構造の活用は、訓練データの効率性とモデルの一般化性能にどのように影響を与えるか?
  • RQ3学習曲線の観点から、訓練データサイズの増加が認識性能にどの程度の影響を与えるか?
  • RQ4提案手法のHMMベースのシステムは、Chars74kデータセットにおいて、DCTベースの最近傍法分類器など、既存の手法と比較してどのように差をつけるか?
  • RQ5今後の研究において、非明示的セグメンテーション手法を、子音+子音+母音(CCV)の複雑な文字組み合わせに対応できるように拡張可能か?

主な発見

  • 提案されたHMMベースの非明示的セグメンテーション手法は、Chars74kデータセットで61.0%の認識精度を達成し、すべての569文字を独立したクラスとして扱った場合と比較して10%の向上を示した。
  • DCTベースの最近傍法分類器(33.3%)と比較して15.9ポイントの精度向上を示し、同じデータセットで優れた性能を発揮した。
  • 学習曲線分析から、訓練データの増加が精度を顕著に向上させることを示し、1文字あたり6つの追加サンプルを追加したことで4%の向上が観察された。
  • 10状態モデルは15状態モデルと比較して、より高い性能とより速いトレーニング速度を達成しており、パラメータ数の削減が一般化性能の向上に寄与していることが示された。
  • 検証精度は10個のGMM成分でピークに達し、それ以上になると低下したため、過剰なモデル複雑性による過学習が生じたことが示された。
  • 結果から、性能の主なボトル neck はモデルアーキテクチャではなく、訓練データの不足であることが示唆され、さらなるデータ収集が顕著な精度向上をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。