Skip to main content
QUICK REVIEW

[論文レビュー] Sparse Concept Coded Tetrolet Transform for Unconstrained Odia Character Recognition

Kalyan S. Dash, Niladri B. Puhan|arXiv (Cornell University)|Apr 3, 2020
Handwritten Text Recognition Techniques参考文献 52被引用数 5
ひとこと要約

本稿では、局所的な筆跡の変動を捉えるために形状に適応するtetroletを活用し、スパースコーディングを用いて特徴を抽出することで、制約なしの手書きオディア文字認識のための新規なスパースコンセプトコーディングtetrolet変換(SCTT)を提案する。この手法は、MNISTで99.40%、ISI Kolkataで99.38%の最先端の認識精度を達成し、PCA、SparsePCA、SparseLDA、およびウェーブレットやStockwell変換といった従来の変換手法を上回る性能を示す。

ABSTRACT

Feature representation in the form of spatio-spectral decomposition is one of the robust techniques adopted in automatic handwritten character recognition systems. In this regard, we propose a new image representation approach for unconstrained handwritten alphanumeric characters using sparse concept coded Tetrolets. Tetrolets, which does not use fixed dyadic square blocks for spectral decomposition like conventional wavelets, preserve the localized variations in handwritings by adopting tetrominoes those capture the shape geometry. The sparse concept coding of low entropy Tetrolet representation is found to extract the important hidden information (concept) for superior pattern discrimination. Large scale experimentation using ten databases in six different scripts (Bangla, Devanagari, Odia, English, Arabic and Telugu) has been performed. The proposed feature representation along with standard classifiers such as random forest, support vector machine (SVM), nearest neighbor and modified quadratic discriminant function (MQDF) is found to achieve state-of-the-art recognition performance in all the databases, viz. 99.40% (MNIST); 98.72% and 93.24% (IITBBS); 99.38% and 99.22% (ISI Kolkata). The proposed OCR system is shown to perform better than other sparse based techniques such as PCA, SparsePCA and SparseLDA, as well as better than existing transforms (Wavelet, Slantlet and Stockwell).

研究の動機と目的

  • 制約なしの手書きオディア文字認識における高い形状的・スタイル的変動の課題に対処すること。
  • 固定ブロックに基づく変換ではなく、形状に適応するtetroletを活用することで、手書き文字認識における特徴表現を向上させること。
  • 低エントロピーのtetrolet係数に対してスパースコンセプトコーディングを適用し、パターンの識別能を向上させること。
  • 多様な script と大規模データベースを対象に評価することで、手法の頑健性と一般化能力を検証すること。
  • 従来のスパースおよび変換ベースの手法を上回る認識精度を達成すること。

提案手法

  • 本手法は、テトロミノに基づく非可分かつ形状に適応する変換であるtetroletを用い、画像を局所的なスペクトル成分に分解することで、筆跡の幾何学的特徴をよりよく捉える。
  • tetroletは、従来のデイアディックウェーブレットブロックの代わりにテトロミノに基づく分割を採用し、手書きのストロークにおける構造的変動を保持する。
  • 冗長性を低減し顕著な特徴を保持するために、低エントロピーのtetrolet係数を抽出する。
  • tetrolet係数に対してスパースコンセプトコーディングを適用し、圧縮表現から高次元の識別的特徴(コンセプト)を抽出する。
  • 最終的な特徴ベクトルは、SVM、ランダムフォレスト、k-NN、MQDFといった標準的な分類器に供給され、認識が行われる。
  • 本手法は、6つの script(オディア、バングラ、デバナガリ、英語、アラビア、テルグ)をカバーする10のデータベースで評価されている。

実験結果

リサーチクエスチョン

  • RQ1固定ブロックに基づく変換と比較して、形状に適応するtetrolet変換は、制約なしの手書き文字認識における特徴表現を改善できるか?
  • RQ2tetrolet係数に対するスパースコンセプトコーディングは、文字認識における識別能を向上させることができるか?
  • RQ3PCA、SparsePCA、SparseLDA、ウェーブレット、Stockwell変換といった既存の手法と比較して、提案されたSCTT手法はどのように性能を発揮するか?
  • RQ4本手法は、多様な script および制約なしの筆跡の変動に一般化可能か?
  • RQ5複数のベンチマークデータベースにおいて、本手法の特徴表現によって達成可能な認識精度はどの程度か?

主な発見

  • 提案されたスパースコンセプトコーディングtetrolet変換(SCTT)は、MNISTデータセットで99.40%の認識精度を達成し、既存の最先端手法を上回る。
  • IITBBSデータベースでは、オディア文字で98.72%、バングラ文字で93.24%の精度を達成し、リソースが限られたスクリプトにおいても優れた性能を示している。
  • ISI Kolkataデータベースでは、オディア文字で99.38%、デバナガリ文字で99.22%の精度を達成し、高い頑健性を示している。
  • 全テストデータベースにおいてPCA、SparsePCA、SparseLDAを常に上回り、tetroletに基づく特徴表現の有効性が裏付けられている。
  • 特に制約なしの筆跡処理において、ウェーブレット、スラン卜ット、Stockwell変換といった従来の変換手法よりもSCTT手法が認識精度で優れている。
  • 6つのスクリプトにわたる大規模な実験により、本手法の一般化能力と多様な書写体系へのスケーラビリティが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。