Skip to main content
QUICK REVIEW

[論文レビュー] Attend And Discriminate: Beyond the State-of-the-Art for Human Activity Recognition using Wearable Sensors

Alireza Abedin, Mahsa Ehsanpour|arXiv (Cornell University)|Jul 14, 2020
Context-Aware Activity Recognition Systems被引用数 4
ひとこと要約

本論文は、センサーモダリティ間の相互作用を明示的にモデル化し、特徴表現のコンパクト性と一般化性能を向上させることで、ウェアラブルセンサーベースの人体活動認識(HAR)のための新規な深層学習フレームワークを提案する。クロスチャネルアテンション、センター損失正則化、データに依存しないミックスアップ増強を用いることで、4つの多様なベンチマークにおいて、相対的に最大6%の精度向上を達成し、新たなSOTA性能を実現した。

ABSTRACT

Wearables are fundamental to improving our understanding of human activities, especially for an increasing number of healthcare applications from rehabilitation to fine-grained gait analysis. Although our collective know-how to solve Human Activity Recognition (HAR) problems with wearables has progressed immensely with end-to-end deep learning paradigms, several fundamental opportunities remain overlooked. We rigorously explore these new opportunities to learn enriched and highly discriminating activity representations. We propose: i) learning to exploit the latent relationships between multi-channel sensor modalities and specific activities; ii) investigating the effectiveness of data-agnostic augmentation for multi-modal sensor data streams to regularize deep HAR models; and iii) incorporating a classification loss criterion to encourage minimal intra-class representation differences whilst maximising inter-class differences to achieve more discriminative features. Our contributions achieves new state-of-the-art performance on four diverse activity recognition problem benchmarks with large margins -- with up to 6% relative margin improvement. We extensively validate the contributions from our design concepts through extensive experiments, including activity misalignment measures, ablation studies and insights shared through both quantitative and qualitative studies.

研究の動機と目的

  • マルチチャネルウェアラブルセンサーモダリティと特定の人体活動との間の潜在的関係をモデル化するという、未だ十分に探査されていない可能性に対処すること。
  • コンピュータビジョン分野で成功を収めたが、ウェアラブルHAR分野ではまだ十分に活用されていない、データに依存しないミックスアップ増強を、マルチモーダルセンサーチャネル時系列データに適用することで、HARにおける一般化性能を向上させること。
  • センター損失を補助最適化目的として組み込むことで、学習済み表現のクラス内ばらつきを低減し、クラス間分離性を向上させること。
  • 多様なウェアラブルHARベンチマークで最先端モデルを上回る、統合的かつ一般化可能なフレームワークの開発

提案手法

  • 79のセンサーチャネル間の潜在的相関を自己アテンションを用いてモデル化するクロスチャネル相互作用エンコーダ(CIE)を導入し、より豊富な特徴マップを生成することで、表現学習を向上させる。
  • 時間的ステップを動的に重み付けする注目型GRUエンコーダ(AGE)を採用し、短い時系列(T=8)において特に最終状態に注目することで、最も情報量の多い隠れ状態を強調する。
  • クラス内特徴分散を最小化し、クラス間マージンを最大化することで、判別性能を向上させるために、センター損失を正則化項として組み込む。
  • 線形補間を用いて2つのサンプル間でマルチチャネル時系列データをミックスアップし、モダリティに依存しない設計で、トレーニングデータの多様性を向上させる。
  • CIE、AGE、センター損失、ミックスアップを統合的にエンドツーエンドの深層学習パイプラインに組み込み、表現品質と一般化性能の共同最適化を実現する。
  • 4つの多様なHARベンチマークで統一された評価プロトコルを用いることで、フレームワークの頑健性と一般化性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1自己アテンションを用いてクロスチャネルセンサーリンクをモデル化することで、ウェアラブルHARにおける表現学習が向上するか?
  • RQ2損失基準としてセンター損失を組み込むことで、HARにおける特徴表現がよりコンパクトかつ判別可能になるか?
  • RQ3データに依存しないミックスアップ増強は、小規模でマルチモーダルセンサーデータに訓練された深層HARモデルを効果的に正則化できるか?
  • RQ4統合フレームワークにおける個々の構成要素(CIE、AGE、センター損失、ミックスアップ)は、性能向上にどのように寄与しているか?
  • RQ5提案されたフレームワークは、多様なウェアラブルセンサーベースHARベンチマークにどの程度一般化可能か?

主な発見

  • 提案フレームワークは、4つの多様なHARベンチマークで、既存のSOTA手法を上回る新たなSOTA性能を達成し、最大で相対的に6%の精度向上を実現した。
  • ミックスアップ単体でも、Opportunityデータセットで精度が5.2%(67.2%から70.7%)向上した。これは、マルチモーダルセンサーシーケンスの増強に有効であることを示している。
  • ミックスアップとセンター損失の組み合わせが最も高い性能向上をもたらした。これは、コンパクト性と分離性の共同最適化が極めて有効であることを示している。
  • 自己アテンションを用いたクロスチャネル相互作用エンコーダ(CIE)は、注目型GRU(AGE)よりも大きな性能向上をもたらした。特に短い時系列において、センサ間依存関係をモデル化できる点が寄与している。
  • 学習済みアテンションスコアの可視化により、意味的で解釈可能なパターンが明らかになった。例えば、飲酒タスクでは右腕IMUに強く注目が集まり、曲げ動作では背中・左腕IMUに注目が集まっていた。これは、モデルの解釈可能性を裏付けている。
  • アブレーションスタディにより、各構成要素(CIE、AGE、センター損失、ミックスアップ)が性能向上に顕著に寄与していることが確認された。特にCIEとセンター損失が個別に最も大きな向上をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。