Skip to main content
QUICK REVIEW

[論文レビュー] Learning behavioral context recognition with multi-stream temporal convolutional networks

Aaqib Saeed, Tanır Özçelebi|TU/e Research Portal|Aug 27, 2018
Context-Aware Activity Recognition Systems被引用数 5
ひとこと要約

本論文は、日常的デバイスからの生のマルチモodalセンサデータ(加速度計、ジャイロスコープ、音声、電話状態)を用いて、エンドツーエンドでマルチラベル行動的文脈認識を実現する、マルチストリーム時空間畳み込みネットワーク(TCN)を提案する。モデルは、モダリティ固有のストリームと文脈化モジュールを用いて表現を統合し、インスタンス重み付けと正則化により、不均衡でスパarselyラベルされた現実世界のデータにおいて高い性能を達成する。マルチタスク学習により欠損モダリティに対してもロバストである。

ABSTRACT

Smart devices of everyday use (such as smartphones and wearables) are increasingly integrated with sensors that provide immense amounts of information about a person's daily life such as behavior and context. The automatic and unobtrusive sensing of behavioral context can help develop solutions for assisted living, fitness tracking, sleep monitoring, and several other fields. Towards addressing this issue, we raise the question: can a machine learn to recognize a diverse set of contexts and activities in a real-life through joint learning from raw multi-modal signals (e.g. accelerometer, gyroscope and audio etc.)? In this paper, we propose a multi-stream temporal convolutional network to address the problem of multi-label behavioral context recognition. A four-stream network architecture handles learning from each modality with a contextualization module which incorporates extracted representations to infer a user's context. Our empirical evaluation suggests that a deep convolutional network trained end-to-end achieves an optimal recognition rate. Furthermore, the presented architecture can be extended to include similar sensors for performance improvements and handles missing modalities through multi-task learning without any manual feature engineering on highly imbalanced and sparsely labeled dataset.

研究の動機と目的

  • 日常的デバイスからの不顕在的でマルチモダリティなセンサデータを用いて、多様で現実的な行動的文脈を認識する課題に対処すること。
  • 手動による特徴工学を経由せずに、生のセンサ信号からエンドツーエンド学習を可能にすること。
  • 現実世界の環境で一般的な、極めて不均衡でスパarselyラベルされたデータセットにおける認識性能を向上させること。
  • さまざまな環境、デバイス利用状況、センサ構成、さらには欠損モダリティを含む状況においても一般化可能なモデルを開発すること。
  • 多変量時系列データにおける人間行動分析に適用可能な、汎用的なマルチモダリティ時系列表現学習フレームワークを提供すること。

提案手法

  • アーキテクチャは、時空間畳み込みネットワーク(TCN)を用いて生のセンサ信号から階層的表現を抽出する、加速度計、ジャイロスコープ、音声、電話状態の4つのモダリティ固有ストリームを採用する。
  • 文脈化モジュールは、すべてのストリームからの表現をラテント相互作用により統合し、マルチラベル行動的文脈の共同推論を可能にする。
  • クラスの不均衡に対処するために、インスタンス重み付き交差エントロピー損失を用いてエンドツーエンドで訓練する。正則化(L1/L2)とドロップアウトを適用して過学習を防ぐ。
  • 共有層が利用可能な入力から強固な表現を学習できるように、マルチタスク学習を活用して欠損モダリティに対応する。
  • 最終全結合層の特徴量に対してt-SNE可視化を適用し、学習済み表現の意味的クラスタリングと分離性を評価する。
  • 標準的な訓練/検証/テスト分割とマルチラベル評価指標を用いて、実世界の大規模なマルチモダリティデータセット上で評価する。

実験結果

リサーチクエスチョン

  • RQ1生のマルチモダリティセンサデータから、現実世界の状況で多様な行動的文脈を、深くエンドツーエンドのマルチストリームTCNで効果的に認識できるか?
  • RQ2インスタンス重み付けと正則化は、極めて不均衡でスパarselyラベルされたデータセットにおけるモデルの一般化性能をどのように向上させるか?
  • RQ3特定のセンサモダリティが欠損している場合、モデルの性能がどの程度維持されるか?
  • RQ4t-SNE可視化によって、学習済み表現が行動的文脈の意味的な変動要因を効果的に分離できているか?
  • RQ5異なるモダリティストリームは、共同学習における最終的予測性能にどのように寄与しているか?

主な発見

  • エンドツーエンドで訓練されたマルチストリームTCNは、手作業による特徴抽出や単一モダリティ学習に依存するモデルを上回る最適な認識性能を達成する。
  • インスタンス重み付き交差エントロピー損失は、レアな正例ラベルの認識性能を顕著に向上させる。この損失関数を除去すると、性能がランダムチョイス水準まで著しく低下する。
  • 正則化技術(ドロップアウト、L1/L2)により過学習が抑制され、正則化を除去した場合、テストセットにおける平均リCALLが0.58に低下することが示された。
  • マルチタスク学習を活用することで、欠損モダリティに対してもモデルはロバストである。再訓練なしで予測性能を維持する。
  • t-SNE可視化から、統合された特徴量が、互いに排他的なラベル(例:屋内 vs 屋外)に対応する意味的に整合性のあるクラスタを形成していることが示され、文脈要因の効果的な分離が確認された。
  • モダリティ固有ネットワークの第1層の特徴マップから、各モダリティに特徴的な学習済みパターンが明らかになった(例:加速度計では運動ダイナミクス、ジャイロスコープでは回転パターン、音声ではスペクトルコンテンツ)。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。