[논문 리뷰] Learning Representations from Audio-Visual Spatial Alignment
이 논문은 360° 영상에서 서로 다른 시점에서 촬영한 오디오와 비디오 클립을 공간 음향과 함께 정렬하도록 훈련하는 자기지도 학습 프리텍스트 작업인 Audio-Visual Spatial Alignment (AVSA)를 제안한다. 트랜스포머와 대비 학습을 통해 다중 시점 360° 표현을 활용함으로써, AVSA는 행동 인식, 의미 분할, 오디오-비디오 정렬 등의 후행 작업 성능을 향상시키며, UCF101과 HMDB51에서 AVC 및 AVTS 기준보다 최대 4% 향상된다.
We introduce a novel self-supervised pretext task for learning representations from audio-visual content. Prior work on audio-visual representation learning leverages correspondences at the video level. Approaches based on audio-visual correspondence (AVC) predict whether audio and video clips originate from the same or different video instances. Audio-visual temporal synchronization (AVTS) further discriminates negative pairs originated from the same video instance but at different moments in time. While these approaches learn high-quality representations for downstream tasks such as action recognition, their training objectives disregard spatial cues naturally occurring in audio and visual signals. To learn from these spatial cues, we tasked a network to perform contrastive audio-visual spatial alignment of 360° video and spatial audio. The ability to perform spatial alignment is enhanced by reasoning over the full spatial content of the 360° video using a transformer architecture to combine representations from multiple viewpoints. The advantages of the proposed pretext task are demonstrated on a variety of audio and visual downstream tasks, including audio-visual correspondence, spatial alignment, action recognition, and video semantic segmentation.
연구 동기 및 목표
- 기존 오디오-비디오 자기지도 학습 방법이 오디오 및 비디오 신호의 공간 정보를 忽略하는 한계를 해결하기 위해.
- 공간적으로 rich한 360° 영상과 앤티비소닉 오디오 데이터를 활용해 표현 학습을 향상시키기 위해.
- 다른 시점에서의 오디오와 비디오를 정렬함으로써 모델이 음원 위치를 국소화하도록 유도하는 프리텍스트 작업을 설계하기 위해.
- 360° 영상의 다중 시점 표현을 트랜스포머 기반 집합으로 활용해 특징 학습을 향상시키기 위해.
- AVSA가 후행 오디오-비디오 및 시각 이해 작업에서 AVC 및 AVTS보다 뛰어나다는 것을 입증하기 위해.
제안 방법
- 모델은 대비 학습을 통해 훈련되며, 양성 쌍은 동일한 360° 영상에서 서로 다른 시점에서 샘플링한 오디오 및 비디오 클립으로 구성되고, 음성 쌍은 다른 영상 또는 시점에서 온다.
- 과정 학습 전략이 적용되며, 초기에는 영상 수준의 대응을 중시하고 나중에 공간 정렬을 도입하여 훈련을 안정화시킨다.
- 네트워크는 서로 다른 방향에서 온 다수의 360° 영상 클립(NFOVs)을 처리하며, 3D CNN 또는 비전 트랜스포머를 사용해 특징을 추출한다.
- 트랜스포머 아키텍처가 다중 시점의 특징을 집계하여 장면의 전체 공간 레이아웃을 모델링함으로써 공간 추론 능력을 향상시킨다.
- 공간 음향이 입력으로 사용되어 모델이 방향성 오디오-비디오 대응을 학습할 수 있도록 한다.
- 최종 표현은 대비 손실을 통해 최적화되어, 정렬된 오디오-비디오 쌍 간의 일치를 극대화하고, 잘못 정렬된 쌍 간의 일치를 최소화한다.
실험 결과
연구 질문
- RQ1자기지도 학습이 360° 영상 데이터에서 공간 음향-비디오 정렬을 통해 이점을 얻을 수 있는가?
- RQ2단일 시점 또는 전역 풀링과 비교해 트랜스포머로 다중 시점 360° 영상 모델링이 표현 품질을 향상시키는가?
- RQ3행동 인식 및 의미 분할 작업에서 AVSA는 AVC 및 AVTS와 비교해 후행 성능가에서 어떻게 다른가?
- RQ4기준 방법에 비해 AVSA는 음원 국소화 능력을 어느 정도 향상시키는가?
- RQ5과정 학습 및 공간 음향이 오디오-비디오 표현의 일반화 능력을 향상시키는가?
주요 결과
- AVSA는 UCF101에서 AVC보다 4% 향상되고, HMDB51에서 3% 향상되며, AVTS보다 각각 3.5%와 2% 향상된다.
- AVSA는 비디오 의미 분할 작업에서 뛰어난 성능을 기록하여 향상된 공간 이해 능력을 보여준다.
- GradCAM 시각화 결과, AVSA 모델이 AVC 모델보다 음원을 더 정확하게 국소화하는 것으로 나타났다.
- 다중 시점 특징을 집계하기 위해 트랜스포머를 사용함으로써 360° 영상 이해 작업에서 성능 향상이著격하게 향상된다.
- 주의 맵의 정성적 분석을 통해 AVSA는 더 나은 오디오 국소화 능력을 제공함을 입증했다.
- 일부 기존 벤치마크보다 데이터셋 크기가 다섯 배 작아도, AVSA는 자기지도 오디오-비디오 학습 분야에서 최고 성능을 달성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.