Skip to main content
QUICK REVIEW

[논문 리뷰] IMU2CLIP: Multimodal Contrastive Learning for IMU Motion Sensors from Egocentric Videos and Text

Seungwhan Moon, Andrea Madotto|arXiv (Cornell University)|2022. 10. 26.
Human Pose and Action Recognition인용 수 9
한 줄 요약

IMU2CLIP는 CLIP를 영감으로 삼아 IMU 동작 센서 데이터를 일관된 표현 공간에 매핑함으로써 이모티콘 비디오 및 텍스트 묘사를 다중모달 대비 학습 프레임워크를 제안한다. 이 방법은 활동 인식 작업에서 상위 성능을 달성하고, 움직임 기반 검색 및 제로샷 다중모달 추론과 같은 새로운 응용 분야를 가능하게 하며, 무작위 초기화 대비 최대 16점의 정확도 향상을 이룬다.

ABSTRACT

We present IMU2CLIP, a novel pre-training approach to align Inertial Measurement Unit (IMU) motion sensor recordings with video and text, by projecting them into the joint representation space of Contrastive Language-Image Pre-training (CLIP). The proposed approach allows IMU2CLIP to translate human motions (as measured by IMU sensors) into their corresponding textual descriptions and videos -- while preserving the transitivity across these modalities. We explore several new IMU-based applications that IMU2CLIP enables, such as motion-based media retrieval and natural language reasoning tasks with motion data. In addition, we show that IMU2CLIP can significantly improve the downstream performance when fine-tuned for each application (e.g. activity recognition), demonstrating the universal usage of IMU2CLIP as a new pre-trained resource. Our code will be made publicly available.

연구 동기 및 목표

  • 모든 실생활 웨어러블 응용 분야에서의 보급을 제한하는 IMU 센서 신호를 위한 대규모 사전 훈련 모델의 부족을 해결하기 위해.
  • 모든 모odal 간의 통합 표현 공간을 학습하여 IMU 기반 작업에 대해 제로샷 및 퍼샷 전이 학습을 가능하게 하기 위해.
  • 비디오에 의존하지 않고도 움직임 기반 미디어 검색 및 다중모달 추론과 같은 새로운 응용 분야에 IMU 데이터를 활용할 수 있음을 입증하기 위해.
  • 향후 연구를 위해 대규모 공개 사전 훈련된 IMU 인코더를 배포하기 위해.

제안 방법

  • IMU 신호, 이모티콘 비디오 클립, 텍스트 묘사를 함께 통합하여 동일한 대비 표현 공간에 매핑하기 위해 CLIP 기반 아키텍처를 미세조정한다.
  • 양성 및 음성 쌍에 대한 대비 손실을 사용하여 대비 학습을 통해 IMU 임베딩을 해당 비디오 및 텍스트 임베딩과 정렬한다.
  • 시각 및 텍스트 인코더의 사전 훈련된 백본을 동결하여 IMU 인코더로 의미 정보를 전이한다.
  • Ego4D 및 Aria와 같은 이모티콘 데이터셋에서의 쌍체 데이터를 사용하여 IMU 인코더를 종합적으로 최적화한다.
  • CLIP의 텍스트 인코더를 사용해 클래스 이름을 임베딩하고, IMU 임베딩에서 최근접 이웃 검색을 통해 매칭함으로써 제로샷 추론을 가능하게 한다.
  • 활동 인식과 같은 작업을 위한 레이블이 있는 데이터셋에서 IMU 인코더를 미세조정할 수 있도록 하여 최종 응용 분야의 훈련을 지원한다.

실험 결과

연구 질문

  • RQ1대비 학습을 통해 IMU 신호를 비디오 및 텍스트와 동일한 임베딩 공간에 효과적으로 정렬할 수 있는가?
  • RQ2대규모 이모티콘 데이터에서의 사전 훈련이 활동 인식 및 검색 작업의 최종 성능을 향상시키는가?
  • RQ3비디오 입력 없이도 IMU2CLIP가 센서 데이터만으로 제로샷 또는 퍼샷 추론을 가능하게 하는가?
  • RQ4IMU, 비디오, 텍스트의 공동 모델링이 모odal 간의 전이성(transitivity)을 어떻게 유지하는가?

주요 결과

  • 미세조정된 IMU2CLIP는 Ego4D 활동 인식 벤치마크에서 65.87%의 정확도를 기록하여 무작위 초기화 모델 대비 15.95점의 절대적 향상을 이뤘다.
  • Aria 데이터셋에서 IMU2CLIP는 미세조정 후 82.31%의 정확도를 기록하여 베이스라인 대비 6.19점 향상되었다.
  • Ego4D에서 IMU-비디오 검색 작업에서는 R@1이 8.48%이고 R@50가 77.67%로, 뛰어난 검색 능력을 입증했다.
  • 비디오-IMU 검색 작업에서는 MRR가 0.190이고 R@50가 78.57%로, 효과적인 다중모달 정렬을 확인했다.
  • 제로샷 프로빙에서 IMU2CLIP는 Ego4D에서 F1 점수 42.16%를 기록하여, 작업 전용 레이블 없이도 의미 있는 의미적 구조를 포착하고 있음을 보여주었다.
  • 비디오 입력 없이도 IMU와 오디오 로그만으로도 GPT-3가 맥락 기반 응답을 생성함으로써 제로샷 다중모달 추론을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.