Skip to main content
QUICK REVIEW

[論文レビュー] Making the Invisible Visible: Action Recognition Through Walls and Occlusions

Tianhong Li, Lijie Fan|arXiv (Cornell University)|Sep 20, 2019
Human Pose and Action Recognition参考文献 47被引用数 12
ひとこと要約

本論文では、壁や遮蔽物の後ろでも動作認識が可能な、3次元人体スケルトンを中間表現として用いる深層学習モデルRF-Actionを提案する。RF信号と視覚ベースのデータセットを共有スケルトン空間で統合することで、可視条件下で87.8 mAP、壁越し条件下で83.0 mAPを達成し、先行するRFベースのシステムを上回り、遮蔽のない状況では視覚ベースの性能と同等となる。

ABSTRACT

Understanding people's actions and interactions typically depends on seeing them. Automating the process of action recognition from visual data has been the topic of much research in the computer vision community. But what if it is too dark, or if the person is occluded or behind a wall? In this paper, we introduce a neural network model that can detect human actions through walls and occlusions, and in poor lighting conditions. Our model takes radio frequency (RF) signals as input, generates 3D human skeletons as an intermediate representation, and recognizes actions and interactions of multiple people over time. By translating the input to an intermediate skeleton-based representation, our model can learn from both vision-based and RF-based datasets, and allow the two tasks to help each other. We show that our model achieves comparable accuracy to vision-based action recognition systems in visible scenarios, yet continues to work accurately when people are not visible, hence addressing scenarios that are beyond the limit of today's vision-based action recognition.

研究の動機と目的

  • 遮蔽、照明不良、壁の存在によってカメラが機能しない状況での人体動作認識を可能にすること。
  • 3次元人体スケルトンを共有の中間表現として用いることで、視覚ベースとRFベースの動作認識のギャップを埋めること。
  • 信頼度に応じたアテンションとマルチプレイヤー動作予測を組み込むことで、RFベースの動作認識の汎化性能とロバスト性を向上させること。
  • 視覚ベースのスケルトンデータセットを用いたマルチモーダルトレーニングが、RFデータに対する性能向上に寄与することを示すこと。

提案手法

  • モデルは入力として生のRF信号を受け取り、ニューラルネットワークを用いて中間表現として3次元人体スケルトンを生成する。
  • 関節の信頼度スコアに基づいて重みを付与する空間的・時間的自己アテンション機構を採用し、ノイズの多いRF由来スケルトンに対するロバスト性を向上させる。
  • マルチプロポーザルモジュールを用いて、同じシーン内で複数人の人物が同時に実行する動作を同時に検出可能にする。
  • スケルトン生成ネットワークを介して損失関数をバックプロパゲートすることで、エンドツーエンドで訓練され、スケルトンの精度が向上する。
  • RFデータと視覚ベースのスケルトンデータセット(例:PKU-MMD、NTU-RGB+D)を統合したマルチモーダルトレーニングにより、被験者や環境にわたる汎化性能が向上する。
  • スケルトン表現により、スケルトン推定と動作認識の共同最適化が可能となり、関節位置の誤差が3.8 cmから3.4 cmに低下する。

実験結果

リサーチクエスチョン

  • RQ1壁や遮蔽物の後ろにいる人物の動作を、視覚ベースのシステムと同等の性能でRF信号から認識できるか?
  • RQ23次元人体スケルトンを中間表現として用いることで、RFベースの動作認識における汎化性能とロバスト性が向上するか?
  • RQ3信頼度に応じたアテンション機構は、ノイズの多いRF由来スケルトンからの誤差を効果的に低減できるか?
  • RQ4マルチプロポーザルモジュールは、複数人の同時動作が発生するシーンでの性能向上に寄与するか?
  • RQ5視覚ベースのスケルトンデータセットを用いたマルチモーダルトレーニングは、RFデータに対する性能向上に寄与するか?

主な発見

  • RF-MMDデータセットにおいて、遮蔽のない条件下で87.8 mAPを達成し、最先端の視覚ベースシステムと同等の性能を示した。
  • 壁越しの状況でも83.0 mAPを維持し、遮蔽や信号ブロックに対して高いロバスト性を示した。
  • アテンションモジュールの導入により、スケルトン推定誤差が3.8 cmから3.4 cmに低下し、非アテンションベースラインと比較してmAPが7.7ポイント向上した。
  • マルチプロポーザルモジュールの導入により、RF-MMDデータセットにおけるmAPが65.5から87.8に上昇し、マルチプレイヤー・マルチアクションシーンでの性能が顕著に向上した。
  • PKU-MMDを用いたマルチモーダルトレーニングにより、RF-MMDデータセットのmAPが83.3から87.8に上昇し、被験者間およびビュー間スプリットにおける汎化性能が向上した。
  • エンドツーエンド訓練により、スケルトンと動作認識ネットワークを別々に訓練した場合と比較して、3次元スケルトン関節誤差が0.4 cm低下し、中間表現の質が向上したことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。