Skip to main content
QUICK REVIEW

[論文レビュー] Interpretable Parallel Recurrent Neural Networks with Convolutional Attentions for Multi-Modality Activity Modeling

Kaixuan Chen, Lina Yao|arXiv (Cornell University)|May 17, 2018
Context-Aware Activity Recognition Systems参考文献 19被引用数 8
ひとこと要約

本稿では、ウェアラブルセンサーを用いたマルチモーダルな人間行動認識(HAR)のため、畳み込み注意機構を備えた解釈可能な並列再帰ニューラルネットワークを提案する。三軸センサー信号をアクティビティフレームに変換し、注目に基づく特徴選択を適用することで、認識精度を向上させるとともに、顕著な身体部位やセンサーモダリティを強調する。その結果、計算コストを低減しつつ、解釈可能性を高めた最先端の性能を達成した。

ABSTRACT

Multimodal features play a key role in wearable sensor-based human activity recognition (HAR). Selecting the most salient features adaptively is a promising way to maximize the effectiveness of multimodal sensor data. In this regard, we propose a "collect fully and select wisely" principle as well as an interpretable parallel recurrent model with convolutional attentions to improve the recognition performance. We first collect modality features and the relations between each pair of features to generate activity frames, and then introduce an attention mechanism to select the most prominent regions from activity frames precisely. The selected frames not only maximize the utilization of valid features but also reduce the number of features to be computed effectively. We further analyze the accuracy and interpretability of the proposed model based on extensive experiments. The results show that our model achieves competitive performance on two benchmarked datasets and works well in real life scenarios.

研究の動機と目的

  • ウェアラブルセンサー信号における個人差やクラス間類似性の問題に対処する。
  • 加速度、角速度、磁気のマルチモーダルセンサー信号間の対ごとの関係を完全に捉えることで、特徴表現を向上させる。
  • 認識精度と解釈可能性の両立を実現する深層学習モデルを開発し、どのセンサーや身体部位が行動分類に最も寄与しているかを明らかにする。
  • 注目機構により、全データ処理を避ける代わりに顕著なセンサーデータ領域にのみ焦点を当てる事で、計算コストを低減する。

提案手法

  • 加速度計、ジャイロスコープ、磁気計の三軸ウェアラブルセンサー信号を、すべてのセンサーサイレント信号およびモダリティ間の対関係を符号化するアクティビティフレームに変換する。
  • 二本のブランチを持つ並列再帰アーキテクチャを構築する:一方は注目に基づくLSTMを用いてアクティビティフレームの顕著なグリムス(断片)に注目し、もう一方は標準LSTMを用いて全フレームを処理する。
  • 各時刻で、グリムスネットワークに従って動的に情報量の多い小さなパッチ(グリムス)をアクティビティフレームから選択する畳み込み注目機構を採用する。
  • 複数のグリムスコピーを用いたモンテカルロサンプリングにより、注目に基づく特徴選択の訓練を安定化させ、耐性を向上させる。
  • 両方のLSTMブランチの出力を連結して分類処理を行い、最終的な行動予測を生成する。
  • 次に最も情報量の多い領域の位置を予測する学習可能なグリムスネットワークを適用し、時間経過に伴う注目領域の段階的改善を可能にする。

実験結果

リサーチクエスチョン

  • RQ1アクティビティフレームとしてのウェアラブルセンサー信号の新規表現は、従来の手法に比べてセンサー間およびモダリティ間の関係をよりよく捉えられるか?
  • RQ2注目に基づく再帰モデルは、ランニング、ウォーキング、横になっているといった行動を区別するために、最も顕著なセンサーモダリティおよび身体部位をどれだけ的確に特定できるか?
  • RQ3全データ処理ベースラインと比較して、提案手法は認識精度を維持または向上させつつ、計算コストをどの程度低減できるか?
  • RQ4注目機構は、どの程度解釈可能であり、行動分類に最も寄与しているセンサーや身体部位を特定する際に、生理学的直感と整合性を示すか?

主な発見

  • 提案モデルはMHEALTH、PAMAP2、MARSのベンチマークデータセットにおいて、既存のSOTA手法を上回る最先端の性能を達成した。
  • ランニングの際、アキレス腱の加速度が最も顕著なモダリティ(30.55%のグリムス)として特定され、次にECGとアキレス腱の角速度が続く。これは生理学的期待と整合的である。
  • 注目機構は、ランニング時には脚部およびアキレス腱を主な寄与部位として効果的に強調しており、腕部への注目は最小限に抑えられており、現実世界の妥当性を裏付けている。
  • 全入力を処理するのではなく、情報量の多いグリムスにのみ焦点を当てるため、計算負荷を低減しつつも高い認識精度を維持している。
  • ハイパーパrameter分析の結果、グリムス窓の幅と高さの比率を4:1に固定すると最適な性能が得られ、異なるデータセットで安定性を示した。
  • ハイパーパrameterの変動に対して強い耐性を示し、グリムス数が特定の値で認識精度がピークに達し、モンテカルロサンプリングのコピー数にも最適値が存在することが判明。これは優れた一般化性能を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。