Skip to main content
QUICK REVIEW

[논문 리뷰] Learning State-Aware Visual Representations from Audible Interactions

Himangi Mittal, Pedro Morgado|arXiv (Cornell University)|2022. 09. 27.
Human Pose and Action Recognition인용 수 14
한 줄 요약

이 논문은 상호작용 순간을 식별하고, 트림되지 않은 에고세트릭 비디오에서 상태 인식 시각 표현을 학습하기 위해 음성 신호를 활용하는 자기지도 학습 방법 RepLAI를 제안한다. 음성 기반의 순간 탐지와 새로운 음성-시각 상태 변화 목적함수를 결합함으로써 RepLAI는 행동 인식, 장기 예측, 물체 상태 변화 분류에서 성능을 향상시키며, Ego4D에서 지도 학습 기반 모델을 능가하고 장기 꼬리 분포에서 강력한 일반화 성능을 보인다.

ABSTRACT

We propose a self-supervised algorithm to learn representations from egocentric video data. Recently, significant efforts have been made to capture humans interacting with their own environments as they go about their daily activities. In result, several large egocentric datasets of interaction-rich multi-modal data have emerged. However, learning representations from videos can be challenging. First, given the uncurated nature of long-form continuous videos, learning effective representations require focusing on moments in time when interactions take place. Second, visual representations of daily activities should be sensitive to changes in the state of the environment. However, current successful multi-modal learning frameworks encourage representation invariance over time. To address these challenges, we leverage audio signals to identify moments of likely interactions which are conducive to better learning. We also propose a novel self-supervised objective that learns from audible state changes caused by interactions. We validate these contributions extensively on two large-scale egocentric datasets, EPIC-Kitchens-100 and the recently released Ego4D, and show improvements on several downstream tasks, including action recognition, long-term action anticipation, and object state change classification.

연구 동기 및 목표

  • 상호작용이 흐리고 정제되지 않은 트림되지 않은 에고세트릭 비디오에서 효과적인 시각 표현을 학습하는 데 도전하는 것.
  • 기존 자기지도 학습 방법이 환경 상태 변화에 민감하도록 유도함으로써 환경 상태 변화에 민감한 표현을 학습하는 데 한계가 있음을 극복하는 것.
  • 음성 신호를 순간 탐지 외에도, 시각 상태 전이에 민감한 표현 학습을 위한 지도 신호로 활용하는 것.
  • 에고세트릭 비디오 환경에서 행동 인식, 장기 행동 예측, 물체 상태 변화 분류의 최종 성능 향상

제안 방법

  • 트림되지 않은 에고세트릭 비디오에서 상호작용 순간(MoI)을 식별하기 위해 수작업으로 구성된 스펙트로그램 기반 탐지기 사용. 학습을 이러한 주목할 만한 세그먼트에 집중.
  • 시간에 따라 시각 상태 변화를 반영할 수 있도록 음성 표현을 유도하는 새로운 음성-시각 자기지도 목적함수인 AStC 도입.
  • AStC 목적함수를 표준 음성-시각 대비(AVC) 손실과 결합하여, 음성-시각 정렬뿐 아니라 상태 인식 표현을 동시에 학습하는 데 목적이 있음.
  • 시각 및 음성 특징을 프로젝션하고 인스턴스 식별을 통해 대비하는 이중 스트림 대비 학습 프레임워크를 사용. MoI 기반 샘플링 적용.
  • MoI 필터링 클립을 사용하여 대규모 에고세트릭 데이터셋(EPIC-Kitchens-100 및 Ego4D)에서 사전 학습하여 표현 품질 향상.
  • t-SNE 시각화를 통해 RepLAI가 기준 모델 대비 더 구분되는 상태 인식 표현을 학습함을 확인함.

실험 결과

연구 질문

  • RQ1트림되지 않은 에고세트릭 비디오에서 음성 신호를 효과적으로 활용해 상호작용 순간을 탐지함으로써 자기지도 표현 학습을 향상시킬 수 있는가?
  • RQ2음성-시각 상태 변화를 모델링하는 자기지도 목적함수는 표준 대비 목적함수보다 더 정보적인 시각 표현을 도출할 수 있는가?
  • RQ3제안된 방법은 에고세트릭 비디오 벤치마크에서 장기 꼬리 분포 및 미리보지 않은 참가자에 대해 기준 모델보다 더 잘 일반화되는가?
  • RQ4제안된 방법의 개별 구성 요소(MoI 탐지 및 AStC 목적함수)가 전체 성능에 기여하는 방식은 어떠한가?

주요 결과

  • RepLAI는 EPIC-Kitchens-100 및 Ego4D 데이터셋에서 행동 인식, 장기 행동 예측, 물체 상태 변화 분류에서 최고 성능(SOTA)을 달성한다.
  • 절단 분석 결과, MoI 탐지 및 AStC 목적함수 모두 필수적이며 상호보완적이며, 각각 성능 향상에 크게 기여함을 확인.
  • RepLAI는 새로운 참가자에 대한 일반화 성능이 뛰어나 제로샷 평가에서 기준 모델을 능가함으로써 강력하고 이식 가능한 표현을 학습함을 시사.
  • EPIC-Kitchens-100의 장기 꼬리 동사 및 명사 클래스에서 RepLAI는 모든 기준 모델을 능가하며, 클래스 불균형에 대한 강건성 향상을 보임.
  • t-SNE 시각화 결과, RepLAI가 AVID나 다른 기준 모델 대비 더 구분되는 상태 인식 표현을 학습하며 더 뚜렷한 클러스터 간 분리가 이루어짐을 확인.
  • Ego4D에서 RepLAI는 완전히 지도 학습 방법과 경쟁 가능하며, 더 큰 다양성 있는 데이터에서 자기지도 학습이 지도 학습 성능에 도달할 수 있음을 시사.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.