Skip to main content
QUICK REVIEW

[論文レビュー] DanHAR: Dual Attention Network For Multimodal Human Activity Recognition Using Wearable Sensors

Wenbin Gao, Lei Zhang|arXiv (Cornell University)|Jun 25, 2020
Context-Aware Activity Recognition Systems参考文献 38被引用数 11
ひとこと要約

本論文では、ウェアラブルセンサーを用いたマルチモーダルなヒューマンアクティビティ認識(HAR)を向上させるために、CNNフレームワーク内にチャネルおよび時間的アテンションを組み合わせたデュアルアテンションネットワーク、DanHARを提案する。センサーモダリティの重要性と重要な時間ステップを同時にモデリングすることで、4つの公開データセットおよび弱ラベル付きデータセットにおいて、最小限のパラメータオーバーヘッドで最先端の精度を達成し、アテンション可視化により解釈可能性と人間の直感との整合性が確認された。

ABSTRACT

Human activity recognition (HAR) in ubiquitous computing has been beginning to incorporate attention into the context of deep neural networks (DNNs), in which the rich sensing data from multimodal sensors such as accelerometer and gyroscope is used to infer human activities. Recently, two attention methods are proposed via combining with Gated Recurrent Units (GRU) and Long Short-Term Memory (LSTM) network, which can capture the dependencies of sensing signals in both spatial and temporal domains simultaneously. However, recurrent networks often have a weak feature representing power compared with convolutional neural networks (CNNs). On the other hand, two attention, i.e., hard attention and soft attention, are applied in temporal domains via combining with CNN, which pay more attention to the target activity from a long sequence. However, they can only tell where to focus and miss channel information, which plays an important role in deciding what to focus. As a result, they fail to address the spatial-temporal dependencies of multimodal sensing signals, compared with attention-based GRU or LSTM. In the paper, we propose a novel dual attention method called DanHAR, which introduces the framework of blending channel attention and temporal attention on a CNN, demonstrating superiority in improving the comprehensibility for multimodal HAR. Extensive experiments on four public HAR datasets and weakly labeled dataset show that DanHAR achieves state-of-the-art performance with negligible overhead of parameters. Furthermore, visualizing analysis is provided to show that our attention can amplifies more important sensor modalities and timesteps during classification, which agrees well with human common intuition.

研究の動機と目的

  • 既存のアテンション機構が時間的またはチャネル別重要性にのみ焦点を当てており、空間的・時間的依存関係を欠いているという限界に対処すること。
  • CNNベースのアーキテクチャにチャネルと時間的アテンションを統合することで、深層学習ベースのHARにおける特徴表現を向上させること。
  • 高価な完全ラベル付きデータセットへの依存を減らし、粗いラベルまたは弱ラベル付きデータからの有効な学習を可能にすること。
  • センサーやアクティビティのタイミングに関する人間の直感と整合するアテンション重みの可視化により、モデルの解釈性を向上させること。
  • 計算オーバーヘッドを低く抑え、実世界のウェアラブルアプリケーションに適した高い精度を達成すること。

提案手法

  • 残留CNNフレームワーク内で、チャネルアテンションと時間的アテンションを同時に適用するデュアルアテンション機構を提案する。
  • スイーツ・アンド・エクスカイト(squeeze-and-excite)ブロックを用いて、重要なセンサーモダリティを強調する学習可能なチャネルアテンション重みを計算する。
  • 入力シーケンス内の時間ステップに対してソフトアテンションを適用し、重要な時間ステップを特定することで、時間的注目を強化する。
  • 要素ごとの乗算と連結によって、チャネルおよび時間的アテンション特徴を統合し、最終分類の前に処理する。
  • 勾配の流れを維持し、学習安定性を向上させるために、残留ネットワークバックボーンを採用する。
  • 交差エントロピー損失を用いて、アテンションと特徴学習を同時に最適化できるエンドツーエンドの学習を実施する。

実験結果

リサーチクエスチョン

  • RQ1チャネルと時間的依存関係の両方をモデリングするデュアルアテンション機構は、マルチモーダルHARのパフォーマンスを向上させることができるか?
  • RQ2本手法のアテンション機構は、単一アテンションまたは再帰型ネットワークベースのアテンションと比較して、精度とパラメータ効率の面で優れているか?
  • RQ3アテンション重みは、センサーやアクティビティのタイミングに関する人間の直感をどの程度反映しているか?
  • RQ4弱ラベル付きデータへも一般化できるか。これにより、高価な完全ラベルの必要性が削減できるか?
  • RQ5RNN(GRUやLSTMなど)と組み合わせたアテンション機構と比較して、CNNアーキテクチャにアテンションを統合した場合、HARタスクで優れた性能を示すか?

主な発見

  • DanHARは、WISDM、PAMAP2、UNIMIB SHAR、OPPORTUNITYの4つの公開HARデータセットにおいて、先行手法と比較して顕著な精度向上を達成し、最先端のパフォーマンスを実現した。
  • PAMAP2データセットでは、残留ネットワークベースラインの誤分類誤差93を75に削減し、優れた一般化性能を示した。
  • モデルは無視できるほどのパラメータオーバーヘッドを維持しており、ウェアラブルデバイスへの実装に適している。
  • 可視化により、チャネルアテンションが関連するセンサー(例:ランニングやロープジャンプでは手首および足首センサー)に高い重みを割り当てており、人間の期待と整合していることが確認された。
  • 時間的アテンションは、自転車走行やジャンプのピークモーショングラフなど、アクティビティシーケンスの重要な時間ステップを効果的に強調した。
  • デュアルアテンション機構により、モダリティおよび時間軸における特徴統合が向上し、モデルの理解可能性と類似アクティビティクラスに対するロバスト性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。