[논문 리뷰] Cross-Modal Attention Consistency for Video-Audio Unsupervised Learning
이 논문은 시각적 및 청각적 모odal 간 이중 방향 국소적 대응을 강제하기 위해 모달별 attention 맵을 교차 모달 가이던스와 정렬함으로써 양방향 국소적 대응을 강제하는 새로운 자기지도 학습 전경과인 Cross-Modal Attention Consistency (CMAC)를 제안한다. 피라미드 attention 기반 기법과 내부 모달 음성 샘플을 포함하는 재구성된 대비 손실을 활용함으로써, 더 낮은 계산 비용으로도 비디오 동작 인식, 검색, 청각 분류 작업에서 최신 기술 수준(SOTA)의 성능을 향상시킨다.
Cross-modal correlation provides an inherent supervision for video unsupervised representation learning. Existing methods focus on distinguishing different video clips by visual and audio representations. We human visual perception could attend to regions where sounds are made, and our auditory perception could also ground their frequencies of sounding objects, which we call bidirectional local correspondence. Such supervision is intuitive but not well explored in the contrastive learning framework. This paper introduces a pretext task, Cross-Modal Attention Consistency (CMAC), for exploring the bidirectional local correspondence property. The CMAC approach aims to align the regional attention generated purely from the visual signal with the target attention generated under the guidance of acoustic signal, and do a similar alignment for frequency grounding on the acoustic attention. Accompanied by a remoulded cross-modal contrastive loss where we consider additional within-modal interactions, the CMAC approach works effectively for enforcing the bidirectional alignment. Extensive experiments on six downstream benchmarks demonstrate that CMAC can improve the state-of-the-art performance on both visual and audio modalities.
연구 동기 및 목표
- 비디오-청각 자기지도 학습에서 세밀한 국소적 대응 감독의 부족 문제를 해결하기 위해.
- 인간 레이블 없이도, 시각적 attention이 소리 발생 영역을 집중하고 청각적 attention이 주목할 만한 물체에서 유래한 주파수를 타겟으로 하는 이중 방향 국소적 대응을 모델링하기 위해.
- 모달별 및 교차 모달 가이던스를 받은 attention 맵 간 일관성을 강제함으로써 시각적 및 청각적 표현 학습을 향상시키기 위해.
- 추가 메모리 비용 없이 내부 모달 상호작용을 포함하는 효율적인 대비 학습 프레임워크를 개발하기 위해.
- 계산 비용이 낮은 설정을 사용하여 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- CMAC는 한 모달에서 유도된 적응형 필터를 사용해 타 모달을 지도하는 피라미드 attention 기반 기법을 도입하여 교차 모달 attention 맵을 생성한다.
- 비디오 신호만으로부터 유도된 시각 인코더 attention 맵을 청각 가이던스를 받은 시각적 attention 맵과 정렬하고, 반대로 청각 인코더의 attention 맵도 시각 가이던스를 받은 맵과 정렬한다.
- 단일 모달 attention 맵과 교차 모달 attention 맵 간의 attention 일관성을 강제함으로써 국소적 대응을 유지한다.
- 이전 배치 데이터로부터 내부 모달 음성 샘플을 포함하는 재구성된 대비 손실을 사용하여 추가 메모리 오버헤드를 피한다.
- 동적이고 적응형 필터를 활용해 모달별 핵심을 학습하고, 이를 통해 다양한 모달 간 attention 정렬을 유도한다.
- 데이터 증강을 적용한 비디오-청각 대비 학습을 통해 엔드 투 엔드로 프레임워크를 훈련한 후, 최종 작업에 대해 선형 프로빙을 수행한다.
실험 결과
연구 질문
- RQ1비디오-청각 표현 학습에서, 시각적 영역와 청각 주파수 간의 이중 방향 국소적 대응이 효과적인 자기지도 신호가 될 수 있는가?
- RQ2인간 레이블 없이도, 시각적 및 청각적 인코더가 관련된 시공간적 영역 및 스펙트럼 영역에 집중하도록 유도하기 위해 교차 모달 attention 일관성을 어떻게 모델링할 수 있는가?
- RQ3모달별 및 교차 모달 가이던스를 받은 attention 맵 간의 attention 일관성을 강제하면, 인스턴스 수준의 대비 학습에 비해 최종 작업 성능이 향상되는가?
- RQ4내부 모달 음성 샘플을 포함하는 재구성된 대비 손실이, 메모리 및 계산 비용을 줄이며 이전 방법보다 더 높은 성능을 달성할 수 있는가?
- RQ5CMAC는 동작 인식, 비디오 검색, 청각 분류 작업에서 시각적 및 청각적 표현을 어느 정도 향상시키는가?
주요 결과
- CMAC는 UCF101 및 HMDB51 동작 인식에서 새로운 최신 기술 수준 성능을 달성하였으며, GPU 비용을 6배 적게 사용하고 배치 크기를 작게 하였음에도 불구하고 각각 GDT를 1.0%와 1.1% 초월하였다.
- 비디오 검색 작업에서는 모든 설정에서 새로운 SOTA 성능을 기록하였으며, 관련 영역에 대한 attention 정렬 덕분에 더 구분력 있는 시각적 표현을 확보한 것으로 나타났다.
- ESC50에서의 청각 분류 작업에서는 81.4%의 정확도를 기록하여 이전 SOTA(78.6%)를 2.8% 초월하였으며, 청각 백본의 미세조정 없이도 성능 향상을 달성하였다.
- DCASE2013과 DCASE2014에서는 각각 76%와 96%의 정확도를 기록하여, GDT를 각각 3%와 2% 초월하였으며, 이는 더 나은 청각 표현 학습을 의미한다.
- 비디오 객체와 연관된 주파수를 국소화함으로써 청각 표현 학습이 크게 향상되었으며, 더 흐릿하고 집중력 있는 attention 맵을 통해 이를 확인할 수 있었다.
- CMAC는 배경 혼잡이 있는 복잡한 장면에서도 효과가 검증되었지만, 레이블 없이 정확한 국소화는 여전히 도전 과제로 남아 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.