Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal Fusion of EMG and Vision for Human Grasp Intent Inference in Prosthetic Hand Control

Mehrshad Zandigohar, Mo Han|arXiv (Cornell University)|Apr 8, 2021
EEG and Brain-Computer Interfaces被引用数 4
ひとこと要約

本論文では、眼の注視方向とRGB動画を用いた筋電図(EMG)と視覚データを統合するベイジアン証拠統合フレームワークを提案する。ニューラルネットワークベースのEMGおよび視覚分類器を時間的フェーズセグメンテーションと組み合わせることで、移動中における把持意思決定分類の平均正答率が95.3%に達し、個々のモダリティ(EMG:13.66%向上、視覚:14.8%向上)を上回る性能を発揮した。

ABSTRACT

Objective: For transradial amputees, robotic prosthetic hands promise to regain the capability to perform daily living activities. Current control methods based on physiological signals such as electromyography (EMG) are prone to yielding poor inference outcomes due to motion artifacts, muscle fatigue, and many more. Vision sensors are a major source of information about the environment state and can play a vital role in inferring feasible and intended gestures. However, visual evidence is also susceptible to its own artifacts, most often due to object occlusion, lighting changes, etc. Multimodal evidence fusion using physiological and vision sensor measurements is a natural approach due to the complementary strengths of these modalities. Methods: In this paper, we present a Bayesian evidence fusion framework for grasp intent inference using eye-view video, eye-gaze, and EMG from the forearm processed by neural network models. We analyze individual and fused performance as a function of time as the hand approaches the object to grasp it. For this purpose, we have also developed novel data processing and augmentation techniques to train neural network components. Results: Our results indicate that, on average, fusion improves the instantaneous upcoming grasp type classification accuracy while in the reaching phase by 13.66% and 14.8%, relative to EMG (81.64% non-fused) and visual evidence (80.5% non-fused) individually, resulting in an overall fusion accuracy of 95.3%. Conclusion: Our experimental data analyses demonstrate that EMG and visual evidence show complementary strengths, and as a consequence, fusion of multimodal evidence can outperform each individual evidence modality at any given time.

研究の動機と目的

  • 筋電図(EMG)における運動アーティファクトや信号のずれ、視覚における遮蔽や照明の問題といった単一モダリティ制御の限界を解消すること。
  • ロボット作動のための意思決定タイミングが極めて重要な移動フェーズにおいて、把持意思決定分類の耐障害性と正確性を向上させること。
  • EMGと視覚データの相補的な強みを活かした統合フレームワークの開発により、分類性能の向上を図ること。
  • コピーペースト増強と時間的フェーズセグメンテーションを含む、新たなデータ処理および増強技術の導入により、モデルの汎化性能を向上させること。
  • マルチモーダル統合が、すべてのフェーズにおいて個々のモダリティを常に上回ることを実証すること、特に移動フェーズで顕著な向上が見られたこと。

提案手法

  • 最大尤度推定を用いて、EMGと視覚的証拠をベイジアン証拠統合フレームワークで統合する。
  • 眼視点RGB動画と眼の注視方向データから把持タイプを分類するための畳み込みニューラルネットワーク(CNN)を用い、コピーペースト増強による背景一般化を実施する。
  • EMG信号分類のための別個のニューラルネットワークを実装し、休息、移動、把持、戻りの各フェーズ検出を含め、時間的ダイナミクスを保持する。
  • 各把持シーケンスを明確な時間的フェーズに分割することで、異なる段階における筋活動パターンの混同を回避する。
  • 融合意思決定に過去の意思決定とシステム制約を組み合わせた時間的スムージングを適用し、正答率を96.8%まで向上させる。
  • 下肢切断者を対象に収集した同期化されたEMGと視覚データセットを用いて、モデルの学習と評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1EMGと視覚のマルチモーダル統合は、個々のモダリティと比較して、把持意思決定分類の正確性をどの程度向上させるか?
  • RQ2時間的フェーズセグメンテーションは、EMGベースの把持分類性能にどのような影響を与えるか?
  • RQ3移動・把持サイクルのどのフェーズで統合が最大の性能向上をもたらすか?
  • RQ4視覚とEMGのモダリティは、遮蔽や安静時における低EMG信号といった相手の欠陥を補い合えるか?
  • RQ5意思決定スムージングは、融合された把持予測の耐障害性と正確性をどの程度向上させるか?

主な発見

  • 移動フェーズにおいて、EMGと視覚の証拠統合により、EMG単体と比較して分類正答率が13.66%向上した。
  • 移動フェーズにおいて、視覚単体と比較して14.8%の正答率向上が確認され、顕著な性能向上が示された。
  • 全体の統合正答率は95.3%に達し、特に制御意思決定にとって最も重要な移動フェーズで95.3%の最高正答率を記録した。
  • 安静時フェーズでは視覚分類器がEMGを上回り(90.69% 対 16.86%)、フェーズごとの相補的な強みが顕著に現れた。
  • 両モダリティが強い証拠を提供している場合でさえも、統合により正答率がさらに向上した。これは、個々のモダリティの性能を超える追加の耐障害性が得られていることを示している。
  • 融合出力に意思決定スムージングを適用した結果、平均正答率が96.8%に上昇した。これは、時間的整合性が実用的運用における有用性を高めていることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。