Skip to main content
QUICK REVIEW

[論文レビュー] Adversary Helps: Gradient-based Device-Free Domain-Independent Gesture Recognition

Jianwei Liu, Jinsong Han|arXiv (Cornell University)|Apr 8, 2020
Hand Gesture Recognition Systems参考文献 22被引用数 5
ひとこと要約

本稿では、勾配ベースの adversarial 訓練を用いてドメインに依存しない指摘なしのジェスチャー認識を実現する新しいフレームワーク DI を提案する。勾配マップの符号マップを新たな深層モデル(AH-Net)を介してドメインギャップ除去要因として活用することで、DI は 10 種類のジェスチャーと 10 ドメインにおいて、CNN で 94.45% の最先端の正確性を達成し、従来の手法が抱えるジェスチャー種別制限や高コストな計算負荷の問題を回避している。

ABSTRACT

Wireless signal-based gesture recognition has promoted the developments of VR game, smart home, etc. However, traditional approaches suffer from the influence of the domain gap. Low recognition accuracy occurs when the recognition model is trained in one domain but is used in another domain. Though some solutions, such as adversarial learning, transfer learning and body-coordinate velocity profile, have been proposed to achieve cross-domain recognition, these solutions more or less have flaws. In this paper, we define the concept of domain gap and then propose a more promising solution, namely DI, to eliminate domain gap and further achieve domain-independent gesture recognition. DI leverages the sign map of the gradient map as the domain gap eliminator to improve the recognition accuracy. We conduct experiments with ten domains and ten gestures. The experiment results show that DI can achieve the recognition accuracies of 87.13%, 90.12% and 94.45% on KNN, SVM and CNN, which outperforms existing solutions.

研究の動機と目的

  • WiFi ベースのジェスチャー認識におけるドメインギャップという重要な課題に取り組むこと。これは、ある環境で訓練されたモデルが別の環境に展開された際に精度が低下する要因となる。
  • ジェスチャー固有の制約や高い計算コストに依存しない、真のドメインに依存しないジェスチャー認識を実現するソリューションを開発すること。
  • 勾配の符号マップから導出される adversarial 例を活用してドメインギャップを除去することで、多様な環境にわたる頑健性を確保すること。
  • EI や CrossSense、WiAG、Widar3.0 といった既存手法よりも、正確性と一般化能力の両面で優れた性能を達成すること。

提案手法

  • ドメイン固有のジェスチャー信号をドメインに依存しない表現に変換するための新しい深層ニューラルネットワーク(AH-Net)を用いる DI フレームワークを提案する。
  • Fast Gradient Sign Method (FGSM) を用いて adversarial サンプルを生成し、勾配マップの符号をドメインギャップ除去要因(DGE)として利用することで、ドメインシフトを最小限に抑える。
  • DGE を適用して特徴表現を再重み付けすることで、訓練中にドメイン不変特徴が学習されるようにする。
  • 分類損失と DGE を用いたドメインギャップ除去を組み合わせた損失関数を用いて、モデルをエンドツーエンドで訓練する。
  • ドメイン不変特徴抽出後に、KNN や SVM、CNN といった複数の分類器をサポートする。
  • t-SNE 視覚化を用いて、DI 加工後、ドメイン固有のクラスタが統合された一様な特徴空間に統合されていることを確認する。

実験結果

リサーチクエスチョン

  • RQ1勾配ベースの adversarial 技法は、多様な環境において WiFi ベースのジェスチャー認識におけるドメインギャップを効果的に除去できるか?
  • RQ2提案された DI フレームワークは、既存のクロスドメインジェスチャー認識手法よりも高い認識正確性を達成できるか?
  • RQ3DI は、Widar3.0 のように速度プロファイルに依存する手法がしばしば無視する静的ジェスチャーの認識をサポートできるか?
  • RQ4ドメインギャップ除去要因におけるハイパーパrameter α の値が、異なる分類器におけるモデル性能にどのように影響するか?
  • RQ5DI フレームワークは計算的に効率的で、複数のジェスチャーとドメインにわたって一般化可能か?

主な発見

  • DI は CNN で 94.45% の認識正確性を達成し、Widar3.0(92.70%) や WiAG(91.40%) といった既存手法を顕著に上回っている。
  • KNN と SVM における正確性はそれぞれ 87.13% と 90.12% に達し、EI や CrossSense を上回っている。
  • CNN では最適なハイパーパrameter α が 0.04 で、最大の正確性が得られ、KNN と SVM では α = 0.19 がピーク性能を示した。
  • t-SNE 視覚化により、ドメインギャップが効果的に除去されており、ドメインやジェスチャーにかかわらずクラスタが統合されていることが確認された。
  • DI は静的ジェスチャー認識をサポートしており、Widar3.0 が速度プロファイルに依存するため静的ジェスチャーでは失敗するのとは対照的である。
  • DI はジェスチャーのパcentile制限を回避し、3 つの基本的学習モデル未満で運用されるため、CrossSense よりも計算的に効率的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。