[論文レビュー] Offline handwritten mathematical symbol recognition utilising deep learning
本稿では、セグメンテーションにSLICを、分類に事前学習済みSqueezeNetを用いた転移学習を行う深層学習フレームワークを提案する。101種類の記号クラスで90%の正確性を達成し、最小限のデータ拡張で、複数クラスのオフライン手書き数式記号認識において最先端の性能を示した。
This paper describes an approach for offline recognition of handwritten mathematical symbols. The process of symbol recognition in this paper includes symbol segmentation and accurate classification for over 300 classes. Many multidimensional mathematical symbols need both horizontal and vertical projection to be segmented. However, some symbols do not permit to be projected and stop segmentation, such as the root symbol. Besides, many mathematical symbols are structurally similar, specifically in handwritten such as 0 and null. There are more than 300 Mathematical symbols. Therefore, designing an accurate classifier for more than 300 classes is required. This paper initially addresses the issue regarding segmentation using Simple Linear Iterative Clustering (SLIC). Experimental results indicate that the accuracy of the designed kNN classifier is 84% for salient, 57% Histogram of Oriented Gradient (HOG), 53% for Linear Binary Pattern (LBP) and finally 43% for pixel intensity of raw image for 66 classes. 87 classes using modified LeNet represents 90% accuracy. Finally, for 101 classes, SqueezeNet ac
研究の動機と目的
- オフライン手書き式における300種類以上の手書き数式記号を認識する課題に対処すること。
- ルート記号やゼロのような複雑で構造的に類似している、または非投影可能な記号のセグメンテーション精度を向上させること。
- 0とnull、大文字と小文字の類似記号を明確に区別できる耐障害性の高い分類器を設計すること。
- 事前学習済みディープネットワークを用いた転移学習により、限られた学習データでも高い認識正確性を達成すること。
- 従来の特徴抽出手法(HOG、LBP、サリエンシー、強度)と深層学習モデル(LeNet、SqueezeNet)を比較評価すること。
提案手法
- 記号セグメンテーションは、手書き記号の構造的特徴を捉えるスーパーセルを生成するため、シンプル・ラインアー・イテラティブ・クラスタリング(SLIC)を用いて実施する。
- 分類には、66クラスおよびその後87クラスで学習された変更版LeNetネットワークを用い、最適な収束と損失制御を得るためのハイパーパrameterを調整した。
- 限られたデータで過学習を回避するために、101種類の数式記号クラスで事前学習済みSqueezeNetモデルを微調整する転移学習を適用した。
- ネットワークはReLU活性化関数、ソフトマックス損失、ADAM最適化を用い、安定した学習のため学習率0.00001とした。
- 性能評価には、複数の特徴抽出手法(ピクセル強度、サリエンシー地図、HOG、LBP)を用い、比較ベースライン分析を実施した。
- 最終モデルは、SqueezeNetの軽量アーキテクチャと18層の深さを活かし、パrameter数を削減しながら高い正確性を維持した。
実験結果
リサーチクエスチョン
- RQ1SLICに基づくスーパーセルセグメンテーションは、ルート記号のような複雑で非投影可能な数式記号に対しても効果的に機能するか?
- RQ2HOG、LBP、サリエンシー、強度といった従来の手作業特徴量は、多クラス数式記号認識において深層学習モデルに比べてどれほど性能を発揮するか?
- RQ3事前学習済みSqueezeNetを用いた転移学習は、100種類以上の記号クラスを含む限られたデータセットで、どれほど認識正確性を向上させられるか?
- RQ4このタスクにおける深層ネットワークの最適収束と正確性を達成するためのハイパーパrameter設定(学習率、最適化関数、活性化関数)は何か?
- RQ5LeNet や SqueezeNet といった深層学習モデルは、広がり続ける記号クラス数に対して、広範なデータ拡張なしで90%以上の正確性を達成できるか?
主な発見
- kNN分類器は、サリエンシー地図を用いて84%の正確性を達成した。HOGでは57%、LBPでは53%、ピクセル強度では43%の正確性を示した(66クラス)。
- 変更版LeNetネットワークは、ReLU活性化関数、ソフトマックス損失、ADAM最適化(学習率0.00001)を用いて、78クラスで85%の正確性を達成した。
- 転移学習を用いることで、事前学習済みSqueezeNetは101種類の数式記号クラスで90%の正確性を達成し、すべてのベースライン手法を上回った。
- ADAM最適化関数と低学習率(1e-5)の組み合わせは、SGDに比べて収束性と最終正確性を顕著に向上させた。
- ReLU活性化関数とソフトマックス損失は、tanh や sigmoid よりも勾配消失問題が低減され、より深いネットワーク(例:変更版LeNet や SqueezeNet)で優れた性能を発揮した。
- SqueezeNetを用いた転移学習により、限られた学習データでも高い性能(90%)を達成でき、低データ量の記号認識タスクにおける有効性が示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。