Skip to main content
QUICK REVIEW

[論文レビュー] TENT: Connect Language Models with IoT Sensors for Zero-Shot Activity Recognition

Yunjiao Zhou, Jianfei Yang|arXiv (Cornell University)|Nov 14, 2023
Multimodal Machine Learning Applications被引用数 6
ひとこと要約

本稿では、対照的学習を用いてIoTセンサーシグナル(カメラ、LiDAR、mmWave)とテキスト埋め込みをアライメントさせる、TENTと呼ばれるマルチモーダル事前学習フレームワークを提案する。これにより、ゼロショット人間行動認識が可能となる。複数モダリティを統合的に学習し、記述的プロンプトと学習可能なソフトプロンプトを組み込むことで、TENTはSOTA(最先端)のゼロショット精度を達成し、MM-Fiデータセットにおいて既存のビジョン・ランゲージモデルを12%以上上回る性能を発揮する。

ABSTRACT

Recent achievements in language models have showcased their extraordinary capabilities in bridging visual information with semantic language understanding. This leads us to a novel question: can language models connect textual semantics with IoT sensory signals to perform recognition tasks, e.g., Human Activity Recognition (HAR)? If so, an intelligent HAR system with human-like cognition can be built, capable of adapting to new environments and unseen categories. This paper explores its feasibility with an innovative approach, IoT-sEnsors-language alignmEnt pre-Training (TENT), which jointly aligns textual embeddings with IoT sensor signals, including camera video, LiDAR, and mmWave. Through the IoT-language contrastive learning, we derive a unified semantic feature space that aligns multi-modal features with language embeddings, so that the IoT data corresponds to specific words that describe the IoT data. To enhance the connection between textual categories and their IoT data, we propose supplementary descriptions and learnable prompts that bring more semantic information into the joint feature space. TENT can not only recognize actions that have been seen but also ``guess'' the unseen action by the closest textual words from the feature space. We demonstrate TENT achieves state-of-the-art performance on zero-shot HAR tasks using different modalities, improving the best vision-language models by over 12%.

研究の動機と目的

  • 言語モデルを用いてIoTセンサーシグナルを解釈し、人間行動認識を可能にする可能性を検討すること。
  • 未学習の行動カテゴリに一般化できない、教師ありHARモデルの限界を克服すること。
  • IoTセンサーフィーチャーとテキスト的記述が統合的にアライメントされる統一された意味的空間を確立し、ゼロショット一般化を実現すること。
  • 記述的アノテーションや学習可能なプロンプトを含むカスタマイズされたテキスト的監視を用いて、ゼロショット性能を向上させること。

提案手法

  • TENTは、対照的学習を用いて、複数モダリティのIoTセンサーフィーチャー(動画、LiDAR、mmWave)とテキスト埋め込みをアライメントする統合的トレーニングパイプラインを採用する。
  • 各ユニモダリックエンコーダーが他のエンコーダーと共同で最適化される、モダリティ相互学習戦略を導入し、特徴のロバスト性とクロスマダリティアライメントを向上させる。
  • 言語抽出器コンponentは、固定されたテキスト記述と学習可能なソフトプロンプトの両方を組み合わせ、意味的監視を豊かにし、埋め込み生成の安定性を高める。
  • モデルは、センサーフィーチャーが対応するテキストラベルに近づくように、統一された意味的特徴空間を学習する。これにより、類似度ベースの検索が可能になり、ゼロショット推論が実現する。
  • フレームワークは、対応するセンサーテキストペア間の類似度を最大化し、非対応ペア間の類似度を最小化する対照的損失を用いる。
  • TENTは、ペアドされたIoTセンサーデータと行動カテゴリの記述を、エンドツーエンドでトレーニングし、統一された空間における意味的近接性により、未観測クラスへの一般化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1カメラ、LiDAR、mmWaveといった多様なIoTセンサーモダリティに、言語モデルを効果的に接続することで、ゼロショット行動認識が可能になるか?
  • RQ2単一モダリティのファインチューニングと比較して、複数モダリティの統合的トレーニングが、ゼロショット一般化をどのように向上させるか?
  • RQ3補助的なテキスト記述と学習可能なソフトプロンプトを組み合わせることで、センサー・言語アライメントにおけるゼロショット性能はどの程度向上するか?
  • RQ4統一された意味的空間は、意味的類似性に基づいて未観測の行動カテゴリ(例:A11やA17)を正確に位置づけることができるか?
  • RQ5TENTは、既存のビジョン・ランゲージモデルと比較して、ゼロショットHARベンチマークでどの程度の性能を示すか?

主な発見

  • TENTは、MM-FiデータセットにおいてSOTAのゼロショット精度を達成し、最も優れた既存のビジョン・ランゲージモデルを12%以上上回る。
  • 動画、LiDAR、mmWaveの3モダリティを統合的にトレーニングした場合、単一モダリティトレーニングよりも一貫して優れた性能を示し、マルチモーダル相互学習の利点を裏付けた。
  • 記述的テキストアノテーションの導入により、mmWaveレーダーのゼロショット精度が7%以上向上し、監視における意味的豊かさの価値を示した。
  • 記述と統合的トレーニングを組み合わせた学習可能なソフトプロンプトの使用は、性能向上に顕著な寄与を示し、埋め込みのロバスト性を高めた。
  • T-SNE可視化により、TENTがセンサーフィーチャーを対応するテキスト特徴に近づけてクラスタリングしていることが確認され、未観測カテゴリ(A11やA17)も意味的空間に正しく位置づけられていることが示された。
  • アブレーションスタディにより、統合的モダリティトレーニングと言語抽出器設計(記述 + ソフトプロンプト)の両方が、最適なゼロショット性能を達成するために不可欠であることが検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。