Skip to main content
QUICK REVIEW

[논문 리뷰] Contrastive Learning of Global and Local Audio-Visual Representations.

Shuang Ma, Zhaoyang Zeng|arXiv (Cornell University)|2021. 04. 07.
Speech and Audio Processing참고 문헌 61인용 수 6
한 줄 요약

이 논문은 전이 학습된 음성-시각 표현을 동시에 최적화하기 위해 두 가지 교차 모odal 대비 목표를 사용하는 자기지도 학습 대비 학습 프레임워크를 제안한다. 이는 전역(예: 분류) 및 국소(예: 위치 지정) 음성-시각 표현을 동시에 최적화한다. 이 방법은 행동/소리 분류, 입술 읽기, 딥페이크 탐지, 소리 원천 위치 지정과 같은 다양한 후행 작업에서 뛰어난 일반화 성능을 달성한다.

ABSTRACT

Contrastive learning has delivered impressive results in many audio-visual representation learning scenarios. However, existing approaches optimize for learning either extit{global} representations useful for tasks such as classification, or extit{local} representations useful for tasks such as audio-visual source localization and separation. While they produce satisfactory results in their intended downstream scenarios, they often fail to generalize to tasks that they were not originally designed for. In this work, we propose a versatile self-supervised approach to learn audio-visual representations that generalize to both the tasks which require global semantic information (e.g., classification) and the tasks that require fine-grained spatio-temporal information (e.g. localization). We achieve this by optimizing two cross-modal contrastive objectives that together encourage our model to learn discriminative global-local visual information given audio signals. To show that our approach learns generalizable video representations, we evaluate it on various downstream scenarios including action/sound classification, lip reading, deepfake detection, and sound source localization.

연구 동기 및 목표

  • 기존의 대비 학습 방법이 전역 또는 국소 표현만 최적화하는 데에 한계가 있다는 점을 해결하기 위해.
  • 고수준의 의미 이해와 세밀한 시공간 정렬에 효과적인 통합된 자기지도 학습 접근법을 개발하기 위해.
  • 다양한 후행 음성-시각 작업에서 제로샷 및 희소샷 전이 성능을 향상시키기 위해.
  • 다양한 유형의 음성-시각 이해가 요구되는 작업에서 학습된 표현의 일반화 능력을 평가하기 위해.

제안 방법

  • 이 방법은 두 가지 교차 모달 대비 목표를 사용한다: 하나는 전역 표현 학습을 위한 것이고, 다른 하나는 국소 표현 학습을 위한 것이다.
  • 전역 대비 손실은 행동 또는 소리 클래스와 같은 전체 비디오 수준의 의미를 위한 음성 및 시각 특징 간의 정렬을 장려한다.
  • 국소 대비 손실은 시간적 및 공간적 수준에서 음성 및 시각 특징 간의 세밀한 정렬을 촉진하여 원천 위치 지정과 같은 작업을 지원한다.
  • 비paired 음성 및 비디오 데이터를 사용하여 자기지도 학습 방식으로 엔드 투 엔드로 모델을 훈련한다.
  • 이중 목표 최적화 덕분에 네트워크는 전역 의미 정보와 국소 시공간 세부 정보를 모두 유지하는 통합된 표현 공간을 학습할 수 있다.
  • 이 접근법은 긍정적인 음성-시각 쌍 간의 일치를 최대화하고, 음의 쌍을 공동 임베딩 공간에서 멀리 떼어내는 데에 대비 학습을 활용한다.

실험 결과

연구 질문

  • RQ1단일 자기지도 학습 프레임워크가 동시에 전역 및 국소 음성-시각 표현을 효과적으로 학습할 수 있는가?
  • RQ2전역 및 국소 대비 목표의 통합 최적화가 다양한 후행 작업에서 제로샷 전이 성능을 어떻게 향상시키는가?
  • RQ3전역 또는 국소 이해가 요구되는 작업에서, 제안된 방법이 작업별로 특화된 대비 모델보다 더 잘 일반화되는가?
  • RQ4학습된 표현이 딥페이크 탐지 및 입술 읽기와 같은 작업에서 제로샷 전이를 얼마나 잘 지원하는가?

주요 결과

  • 제안된 방법은 행동 및 소리 분류에서 최신 기술 수준의 제로샷 성능을 달성하여, 이러한 작업에 특화해 훈련된 모델들을 능가한다.
  • 입술 읽기 작업에서 뛰어난 성능을 기록하여, 학습된 국소 표현이 세밀한 시각-음성 대응에 효과적임을 입증한다.
  • 딥페이크 탐지 작업으로도 잘 일반화되어, 미세한 시각-시각 및 음성-시각 불일치에 대해 강건함을 보여준다.
  • 소리 원천 위치 지정 작업에서 경쟁력 있는 성능을 기록하여, 국소 대비 목표가 시공간 정렬에 가치가 있음을 확인한다.
  • 제거 실험 결과, 전역 및 국소 대비 목표를 모두 사용할 경우 단일 목표만 사용하는 것보다 더 높은 성능을 얻는다.
  • 특수한 작업 미세조정 없이도 다양한 후행 작업으로 효과적으로 일반화되어, 이 방법의 유연성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.