[論文レビュー] TraHGR: Transformer for Hand Gesture Recognition via ElectroMyography
本稿では、スパースなマルチチャネル表面筋電図(sEMG)を用いた手のジェスチャー認識のための、ハイブリッドなトランスフォーマー基盤の深層学習フレームワーク、TraHGRを提案する。2つの並列パス——トランスフォーマーエンコーダによる時系列モデリングと、CNNによる空間的特徴抽出——を組み合わせ、その後に統合層を設けることで、DB2-Dサブセット(9つのジェスチャー)で93.84%の最先端の正確度を達成し、従来手法を最大4.30%上回った。
Deep learning-based Hand Gesture Recognition (HGR) via surface Electromyogram (sEMG) signals has recently shown significant potential for development of advanced myoelectric-controlled prosthesis. Existing deep learning approaches, typically, include only one model as such can hardly maintain acceptable generalization performance in changing scenarios. In this paper, we aim to address this challenge by capitalizing on the recent advances of hybrid models and transformers. In other words, we propose a hybrid framework based on the transformer architecture, which is a relatively new and revolutionizing deep learning model. The proposed hybrid architecture, referred to as the Transformer for Hand Gesture Recognition (TraHGR), consists of two parallel paths followed by a linear layer that acts as a fusion center to integrate the advantage of each module and provide robustness over different scenarios. We evaluated the proposed architecture TraHGR based on the commonly used second Ninapro dataset, referred to as the DB2. The sEMG signals in the DB2 dataset are measured in the real-life conditions from 40 healthy users, each performing 49 gestures. We have conducted extensive set of experiments to test and validate the proposed TraHGR architecture, and have compared its achievable accuracy with more than five recently proposed HGR classification algorithms over the same dataset. We have also compared the results of the proposed TraHGR architecture with each individual path and demonstrated the distinguishing power of the proposed hybrid architecture. The recognition accuracies of the proposed TraHGR architecture are 86.18%, 88.91%, 81.44%, and 93.84%, which are 2.48%, 5.12%, 8.82%, and 4.30% higher than the state-ofthe-art performance for DB2 (49 gestures), DB2-B (17 gestures), DB2-C (23 gestures), and DB2-D (9 gestures), respectively.
研究の動機と目的
- 限られたデータと電極配置の感度に起因する、スパースなマルチチャネルsEMGに基づく手のジェスチャー認識における低精度の課題に対処する。
- 実世界の多様な状況において一般化性能に限界を示す単一モデルの深層学習手法の課題を克服する。
- トランスフォーマーのアテンションメカニズムを活用し、sEMG信号における長距離の時系列依存性をモデル化するとともに、空間的筋活動パターンを保持する。
- 時系列と空間的表現を統合するハイブリッドアーキテクチャを構築し、多様なジェスチャー集合に対してより高いロバスト性とパフォーマンスを実現する。
- 従来の機械学習手法および既存のDNNベースの手法と比較して、ベンチマーク用のNinapro DB2データセットで優れた性能を示す。
提案手法
- 二重パスのハイブリッドアーキテクチャを設計:1つのパスは、マルチヘッド自己注意機構を用いて長距離の時系列依存性を捉えるトランスフォーマー・エンコーダによってsEMG信号を処理する。
- 2番目のパスは、1次元畳み込みニューラルネットワーク(CNN)を用いてマルチチャネルsEMG信号からの局所的な空間的パターンを抽出する。
- 両パスの出力を、線形変換を用いた学習可能な統合層で統合し、最終的な分類に用いる表現を結合する。
- 最終予測のための交差エントロピー損失に加え、各パスにおける中間監視のための補助損失を含む、複数成分の損失関数を用いてモデルを訓練する。
- Adam最適化アルゴリズムと学習率スケジューリングを用いて、バックプロパゲーションにより全体のアーキテクチャをエンドツーエンドで最適化する。
- 一般化性能の向上を図るため、データオーグメンテーションおよび正規化技術を適用する。
実験結果
リサーチクエスチョン
- RQ1実生活の条件下で、sEMGに基づく手のジェスチャー認識において、ハイブリッドなトランスフォーマー-CNNアーキテクチャは、単一モデルの深層学習手法を上回ることができるか?
- RQ2RNN や CNN と比較して、トランスフォーマーの自己注意メカニズムは、スパースなsEMG信号の時系列モデリングにおいてどの程度向上をもたらすか?
- RQ3時系列(トランスフォーマー)と空間的(CNN)表現の統合は、異なるジェスチャー集合および被験者間での一般化性能を向上させるか?
- RQ4提案された複数成分損失関数は、標準の交差エントロピー損失と比較して、モデルの収束性および認識正確度にどのような影響を与えるか?
- RQ5提案されたTraHGRフレームワークは、特に小さなジェスチャーサブセットにおいても、Ninapro DB2データセットで最先端のパフォーマンスを達成できるか?
主な発見
- TraHGRは、全DB2データセット(49のジェスチャー)で86.18%の認識正確度を達成し、最先端のDNN手法を2.48%上回った。
- DB2-Bサブセット(17のジェスチャー)では88.91%の正確度を達成し、前回の最先端手法を5.12%上回った。
- DB2-Cサブセット(23のジェスチャー)では81.44%の正確度を達成し、過去最高の手法よりも8.82%の向上を示した。
- DB2-Dサブセット(9のジェスチャー)では93.84%の正確度を達成し、前回の最先端手法を4.30%上回った。
- アブレーションスタディの結果、ジョイントトレーニングと複数成分損失を組み合わせたハイブリッドアーキテクチャが、個々のパス(TNetとFNet)を上回ることを確認し、特徴統合の有効性を裏付けた。
- 短いウィンドウサイズでも優れたパフォーマンスを維持した——例として100msでは84.13%の正確度を達成し、200msで81.1%の正確度を示した先行手法を上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。