Skip to main content
QUICK REVIEW

[논문 리뷰] TENT: Connect Language Models with IoT Sensors for Zero-Shot Activity Recognition

Yunjiao Zhou, Jianfei Yang|arXiv (Cornell University)|2023. 11. 14.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

이 논문은 대비 학습을 통해 IoT 센서 신호(카메라, LiDAR, 밀리미터파)와 텍스트 임베딩을 정렬함으로써 제로샷 인간 활동 인식을 가능하게 하는 다중모달 사전학습 프레임워크인 TENT을 제안한다. 다양한 모odal 간 공동 학습과 기술적 프롬프트, 학습 가능한 소프트 프롬프트를 통합함으로써 TENT는 기존의 시각-언어 모델보다 12% 이상 향상된 최신 기술 수준의 제로샷 정확도를 달성한다. MM-Fi 데이터셋에서의 성능을 바탕으로 한다.

ABSTRACT

Recent achievements in language models have showcased their extraordinary capabilities in bridging visual information with semantic language understanding. This leads us to a novel question: can language models connect textual semantics with IoT sensory signals to perform recognition tasks, e.g., Human Activity Recognition (HAR)? If so, an intelligent HAR system with human-like cognition can be built, capable of adapting to new environments and unseen categories. This paper explores its feasibility with an innovative approach, IoT-sEnsors-language alignmEnt pre-Training (TENT), which jointly aligns textual embeddings with IoT sensor signals, including camera video, LiDAR, and mmWave. Through the IoT-language contrastive learning, we derive a unified semantic feature space that aligns multi-modal features with language embeddings, so that the IoT data corresponds to specific words that describe the IoT data. To enhance the connection between textual categories and their IoT data, we propose supplementary descriptions and learnable prompts that bring more semantic information into the joint feature space. TENT can not only recognize actions that have been seen but also ``guess'' the unseen action by the closest textual words from the feature space. We demonstrate TENT achieves state-of-the-art performance on zero-shot HAR tasks using different modalities, improving the best vision-language models by over 12%.

연구 동기 및 목표

  • 언어 모델을 활용해 IoT 센서 신호를 해석하여 인간 활동 인식을 수행할 수 있는지의 가능성을 탐색한다.
  • 기존의 감독 학습 기반 HAR 모델이 새로운 활동 카테고리에 일반화할 수 없는 한계를 극복한다.
  • IoT 센서 특징과 텍스트 기술 간의 공동 정렬을 통해 통합된 의미 공간을 구축하여 제로샷 일반화를 가능하게 한다.
  • 기술판단 및 학습 가능한 프롬프트를 포함한 맞춤형 텍스트 기반 감독을 통해 제로샷 성능을 향상시킨다.

제안 방법

  • TENT는 대비 학습을 사용하여 다중모달 IoT 센서 특징(영상, LiDAR, 밀리미터파)과 텍스트 임베딩을 정렬하는 공동 학습 파이프라인을 적용한다.
  • 각 단일 모달 인코더가 서로 함께 최적화되도록 하는 모달 간 상호 학습 전략을 도입하여 특징의 강건성과 다중모달 정렬을 향상시킨다.
  • 고정된 텍스트 기술과 학습 가능한 소프트 프롬프트를 모두 포함하는 언어 추출기 컴ponent가 의미적 감독을 풍부하게 하고 임베딩 생성의 안정성을 제고한다.
  • 모델은 센서 임베딩이 해당하는 텍스트 레이블과 가까이 위치하도록 통합된 의미 특징 공간을 학습하며, 이는 제로샷 추론을 위한 유사도 기반 검색을 가능하게 한다.
  • 프레임워크는 일치하는 센서-텍스트 쌍 간의 유사도를 극대화하고, 비일치하는 쌍 간의 유사도를 최소화하는 대비 손실을 사용한다.
  • TENT는 쌍화된 IoT 센서 데이터와 활동 카테고리 기술을 기반으로 엔드 투 엔드로 학습되며, 통합된 공간 내 의미적 유사성에 기반해 새로운 클래스로의 일반화가 가능하다.

실험 결과

연구 질문

  • RQ1언어 모델은 카메라, LiDAR, 밀리미터파와 같은 다양한 IoT 센서 모달과 효과적으로 연결되어 제로샷 활동 인식을 가능하게 할 수 있는가?
  • RQ2단일 모달 미세조정 대비 다중모달 공동 학습이 제로샷 일반화에 어떻게 기여하는가?
  • RQ3보조적 텍스트 기술과 학습 가능한 소프트 프롬프트는 센서-언어 정렬에서 제로샷 성능을 어느 정도 향상시키는가?
  • RQ4통합된 의미 공간은 의미 유사성에 기반해 새로운 활동 카테고리를 정확히 위치시킬 수 있는가?
  • RQ5기존의 시각-언어 모델 대비 TENT는 제로샷 HAR 벤치마크에서 어떻게 성능을 냈는가?

주요 결과

  • TENT는 MM-Fi 데이터셋에서 최신 기술 수준의 제로샷 정확도를 달성하였으며, 기존의 최고 성능을 보인 시각-언어 모델보다 12% 이상 향상되었다.
  • 영상, LiDAR, 밀리미터파의 세 모달 간 공동 학습이 단일 모달 학습보다 일관되게 뛰어난 성능을 보이며, 다중모달 상호 학습의 이점을 입증한다.
  • 기술판단의 포함으로 mmWave 레이더의 제로샷 정확도가 7% 이상 향상되었으며, 감독의 의미적 풍부성이 중요한 가치를 지닌다.
  • 기술판단과 공동 학습을 통해 학습 가능한 소프트 프롬프트를 사용할 경우 성능 향상이著명하게 이루어지며, 임베딩의 강건성을 제고한다.
  • T-SNE 시각화 결과 TENT는 센서 임베딩을 해당 텍스트 기술 주변에 잘 군집화하고, A11 및 A17와 같은 새로운 카테고리를 의미 공간 내에서 정확히 위치시킴을 확인하였다.
  • 제거 실험을 통해 공동 모달 학습과 언어 추출기 설계(기술판단 + 소프트 프롬프트)가 최적의 제로샷 성능을 달성하는 데 필수적임을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.