Skip to main content
QUICK REVIEW

[論文レビュー] Neural Architecture based on Fuzzy Perceptual Representation For Online Multilingual Handwriting Recognition

Hanen Akouaydi, Sourour Njah|arXiv (Cornell University)|Aug 1, 2019
Handwritten Text Recognition Techniques参考文献 33被引用数 11
ひとこと要約

本論文では、曖昧な知覚的表現と畳み込みLSTMを用いたオンライン多言語手書き認識のための2つのディープラーニングベースのシステムを提案する。最初のシステムは、ベータ楕円型モデルを用いて知覚的ストローク特徴を抽出し、それをLSTMで分類する。2番目のシステムは、モバイルデバイスからの(x, y, z)軌道データに直接ConvLSTMを適用する。この手法は、複数のデータベースでラテン文字およびアラビア文字において98%を超える認識精度を達成し、ノイズや知覚的あいまいさに対して高い耐性を示している。

ABSTRACT

Due to the omnipresence of mobile devices, online handwritten scripts have become the most important feeding input to smartphones and tablet devices. To increase online handwriting recognition performance, deeper neural networks have extensively been used. In this context, our paper handles the problem of online handwritten script recognition based on extraction features system and deep approach system for sequences classification. Many solutions have appeared in order to facilitate the recognition of handwriting. Accordingly, we used an existent method and combined with new classifiers in order to get a flexible system. Good results are achieved compared to online characters and words recognition system on Latin and Arabic scripts. The performance of our two proposed systems is assessed by using five databases. Indeed, the recognition rate exceeds 98%.

研究の動機と目的

  • 知覚ベースの特徴抽出とディープラーニングを用いて、多言語スクリプトのオンライン手書き認識性能を向上させること。
  • 書込み速度、スタイル、ノイズのばらつきに起因する手書きの変動を、知覚的前処理フレームワークによって解消すること。
  • 多様なスクリプトにおいて文字レベルおよび語レベルの認識を両立できる柔軟で耐障害性の高いシステムの開発。
  • 実世界のモバイルデバイスで取得したデータおよび標準ベンチマーク上でのシステム性能の評価。
  • ストロークセグメンテーションの診断的潜在的価値を、振戦関連の手書き異常を検出するために探求すること。

提案手法

  • 知覚的システムでは、近接性および類似性の法則に基づいて、手書きストロークを基本的な知覚的単位に分割するベータ楕円型モデルを用いる。
  • ストロークは原始的知覚的コード(BCP)に分類され、その出力がLSTMネットワークに供給され、シーケンス分類が行われる。
  • 2番目のシステムでは、モバイルデバイスからの生の(x, y, z)軌道データに直接ConvLSTMを適用し、エンドツーエンド認識を実現する。
  • 知覚的不確実性をモデル化するため、ファジィ論理およびファジィ真値トレーニング戦略をシステムに統合する。
  • ノイズ耐性は、トレーニングおよびテストセットにランダムノイズを注入することで評価され、さまざまなノイズレベルでの性能が測定される。
  • ベータ楕円型モデルは、セグメンテーションの目的だけでなく、ノイズ低減および信号サンプリングといった前処理の目的にも用いられる。

実験結果

リサーチクエスチョン

  • RQ1人間の知覚的法則に基づく曖昧な知覚的表現が、オンライン手書き認識の精度を向上させられるか?
  • RQ2ストロークセグメンテーションにベータ楕円型モデルを統合することで、ノイズ環境下での認識性能がどの程度向上するか?
  • RQ3エンドツーエンドのConvLSTMベースのシステムは、多言語データセットにおいて知覚的特徴ベースのアプローチをどの程度上回るか?
  • RQ4知覚的モデルは、神経疾患に起因する振戦関連の手書き異常を検出し、診断支援に役立てられるか?
  • RQ5手書きにおける知覚的錯覚(例:'0'と'O'、'1'と'l'の誤認)が認識システムに与える影響は何か?また、提案手法はこうした誤りを緩和できるか?

主な発見

  • 提案された知覚ベースのシステム(OnHSR-LSTM)は、分離語のIR0N0FFデータベースで93%の認識率を達成した。
  • ConvLSTMベースのシステム(OnHR-convLSTM)は、IR0N0FFデータベースで98%の認識率を達成し、知覚的手法を上回った。
  • LMCAおよび手動セグメンテーション済みADABデータベースでは、OnHR-convLSTMシステムが98.5%の認識精度に達し、多言語スクリプトにおいて高い性能を示した。
  • ノイズを追加した状態で、前処理なしのOnHR-convLSTMシステムは50.45%まで低下したが、tetaおよび4 EPCsを用いることで74.41%まで向上し、前処理の有効性が示された。
  • ベータ楕円型モデルは、ノイズおよび振戦の影響を効果的に低減した。可視化結果から、スクリプトの軌跡から振戦の揺れが明確に除去されていることが確認された。
  • システムは知覚的錯覚(例:'0'と'O'、'1'と'l'のあいまいさ)に対して耐性を示し、文脈的および動的特徴を活用することで、こうした誤りを緩和した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。