Skip to main content
QUICK REVIEW

[论文解读] TENT: Connect Language Models with IoT Sensors for Zero-Shot Activity Recognition

Yunjiao Zhou, Jianfei Yang|arXiv (Cornell University)|Nov 14, 2023
Multimodal Machine Learning Applications被引用 6
一句话总结

本文提出TENT,一种多模态预训练框架,通过对比学习将物联网传感器信号(摄像头、LiDAR、毫米波)与文本嵌入对齐,以实现零样本人体活动识别。通过跨模态联合训练,并结合描述性提示和可学习的软提示,TENT在MM-Fi数据集上实现了最先进的零样本准确率,相较于现有视觉-语言模型提升超过12%。

ABSTRACT

Recent achievements in language models have showcased their extraordinary capabilities in bridging visual information with semantic language understanding. This leads us to a novel question: can language models connect textual semantics with IoT sensory signals to perform recognition tasks, e.g., Human Activity Recognition (HAR)? If so, an intelligent HAR system with human-like cognition can be built, capable of adapting to new environments and unseen categories. This paper explores its feasibility with an innovative approach, IoT-sEnsors-language alignmEnt pre-Training (TENT), which jointly aligns textual embeddings with IoT sensor signals, including camera video, LiDAR, and mmWave. Through the IoT-language contrastive learning, we derive a unified semantic feature space that aligns multi-modal features with language embeddings, so that the IoT data corresponds to specific words that describe the IoT data. To enhance the connection between textual categories and their IoT data, we propose supplementary descriptions and learnable prompts that bring more semantic information into the joint feature space. TENT can not only recognize actions that have been seen but also ``guess'' the unseen action by the closest textual words from the feature space. We demonstrate TENT achieves state-of-the-art performance on zero-shot HAR tasks using different modalities, improving the best vision-language models by over 12%.

研究动机与目标

  • 探索利用语言模型解释物联网传感信号以实现人体活动识别的可行性。
  • 克服监督式HAR模型无法泛化到未见活动类别的局限性。
  • 建立一个统一的语义空间,使物联网传感器特征与文本描述能够联合对齐,以实现零样本泛化。
  • 通过定制化文本监督(包括描述性注释和可学习提示)提升零样本性能。

提出的方法

  • TENT采用联合训练流程,利用对比学习将多模态物联网传感器特征(视频、LiDAR、毫米波)与文本嵌入对齐。
  • 提出一种模态互学习策略,使每个单模态编码器与其他模态联合优化,以提升特征鲁棒性与跨模态对齐能力。
  • 语言提取器组件结合固定文本描述与可学习软提示,以丰富语义监督并稳定嵌入生成。
  • 模型学习一个统一的语义特征空间,使传感器嵌入与其对应文本标签在空间中靠近,从而支持基于相似度的检索以实现零样本推理。
  • 框架使用对比损失,最大化匹配的传感器-文本对之间的相似度,同时最小化不匹配对之间的相似度。
  • TENT在配对的物联网传感器数据与活动类别描述上进行端到端训练,通过统一空间中的语义接近性实现对未见类别的泛化。

实验结果

研究问题

  • RQ1语言模型能否有效连接至多样化的物联网传感器模态(摄像头、LiDAR、毫米波),以实现零样本活动识别?
  • RQ2与单模态微调相比,跨模态联合训练在零样本泛化方面有何提升?
  • RQ3补充的文本描述与可学习软提示在传感器-语言对齐中的零样本性能提升程度如何?
  • RQ4统一语义空间能否基于语义相似性准确地定位未见的活动类别?
  • RQ5TENT在零样本HAR基准测试中与现有视觉-语言模型相比表现如何?

主要发现

  • TENT在MM-Fi数据集上实现了最先进的零样本准确率,相较于最佳现有视觉-语言模型提升超过12%。
  • 在所有三种模态(视频、LiDAR、毫米波)上进行联合训练,始终优于单模态训练,证明了多模态互学习的优势。
  • 引入描述性文本注释使毫米波雷达的零样本准确率提升超过7%,凸显了语义丰富监督的价值。
  • 当与描述和联合训练结合时,可学习软提示显著提升性能,增强了嵌入的鲁棒性。
  • T-SNE可视化结果表明,TENT成功地将传感器嵌入聚类在对应文本特征附近,并在语义空间中正确地定位了未见类别(如A11和A17)。
  • 消融实验验证了联合模态训练与语言提取器设计(描述 + 软提示)对实现最优零样本性能至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。