Skip to main content
QUICK REVIEW

[논문 리뷰] Audio-visual Generalised Zero-shot Learning with Cross-modal Attention and Language

Otniel-Bogdan Mercea, Lukas Riesch|arXiv (Cornell University)|2022. 03. 07.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 음성-시각 일반화 제로샷 학습(GZSL)을 위한 교차모달 어텐션 모델인 AVCA를 제안한다. AVCA는 음성-시각 임베딩을 텍스트 레이블 임베딩과 정렬함으로써 성능을 향상시킨다. 모달 간 교차어텐션과 새로운 손실 함수를 활용하여, VGGSound, UCF101, ActivityNet 세 가지 새로운 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 특히 미사용 클래스에서 두드러진 성능 향상을 보였다.

ABSTRACT

Learning to classify video data from classes not included in the training data, i.e. video-based zero-shot learning, is challenging. We conjecture that the natural alignment between the audio and visual modalities in video data provides a rich training signal for learning discriminative multi-modal representations. Focusing on the relatively underexplored task of audio-visual zero-shot learning, we propose to learn multi-modal representations from audio-visual data using cross-modal attention and exploit textual label embeddings for transferring knowledge from seen classes to unseen classes. Taking this one step further, in our generalised audio-visual zero-shot learning setting, we include all the training classes in the test-time search space which act as distractors and increase the difficulty while making the setting more realistic. Due to the lack of a unified benchmark in this domain, we introduce a (generalised) zero-shot learning benchmark on three audio-visual datasets of varying sizes and difficulty, VGGSound, UCF, and ActivityNet, ensuring that the unseen test classes do not appear in the dataset used for supervised training of the backbone deep models. Comparing multiple relevant and recent methods, we demonstrate that our proposed AVCA model achieves state-of-the-art performance on all three datasets. Code and data are available at \url{https://github.com/ExplainableML/AVCA-GZSL}.

연구 동기 및 목표

  • 학습 데이터에 포함되지 않은 클래스에 대한 비디오 데이터를 분류하는 데 도전하는 음성-시각 제로샷 학습(ZSL) 문제를 다루기.
  • 기존 ZSL 벤치마크에서 학습, 검증, 테스트 세트 간의 클래스 중복으로 인한 과적합 및 과도한 성능 향상 문제를 해결하기.
  • VGGSound, UCF101, ActivityNet 세 가지 다양한 데이터셋을 활용하여, 학습 및 테스트 세트 간 클래스 泄漏가 없는 통합된 현실적인 음성-시각 GZSL 벤치마크를 구축하기.
  • 음성 및 시각 특징을 교차어텐션을 통해 융합하면서 단모달 정보를 유지하는 계산 효율성이 높은 다중스트림 모델 설계하기.
  • 다중모달 표현이 제로샷 일반화에서 단모달 기반 모델보다 뚜렷하게 뛰어나며, 특히 미사용 클래스에서 성능 향상이 두드러짐을 입증하기.

제안 방법

  • 음성 및 시각 인코더를 별도로 갖춘 다중스트림 신경망 AVCA를 제안하며, 교차어텐션 메커니즘을 통해 양 모달 간 정보를 교환하여 통합 표현을 구축한다.
  • ZSL 작업에 대한 정보 泄漏를 방지하기 위해, 자기지도 학습 기반 SeLaVi 모델에서 사전 추출한 음성 및 시각 특징을 사용한다.
  • 삼중체 기반의 대비 손실과 융합 표현 내에서 주목할 만한 단모달 특징을 유지하는 데 중점을 둔 정규화 손실($l_c$)을 조합하여 모델을 훈련시킨다.
  • 최종 음성-시각 임베딩을 텍스트 레이블 임베딩과 교차어텐션을 통해 정렬함으로써, 가장 유사한 레이블 임베딩을 찾는 방식으로 제로샷 예측을 가능하게 한다.
  • 모델이 관련 교차모달 신호에 주목하면서도, 분류에 유용한 단모달 정보를 유지하도록 유도하는 새로운 훈련 목표를 도입한다.
  • 일반화된 ZSL 설정에서 모든 학습 클래스가 테스트 검색 공간에 간섭자로 존재하는 조건에서, 조화 평균(HM)과 제로샷 학습(ZSL) 정확도를 평가 지표로 적용한다.

실험 결과

연구 질문

  • RQ1학습 데이터에 존재하지 않는 테스트 클래스에 대해, 음성 및 시각 스트림 간의 교차모달 어텐션이 제로샷 일반화 성능을 향상시키는가?
  • RQ2음성-시각 표현과 함께 텍스트 레이블 임베딩을 활용할 경우, 단모달 또는 비어텐션 기반 다중모달 방법보다 미사용 클래스에서 더 높은 성능을 달성하는가?
  • RQ3학습 및 테스트 세트 간 클래스 중복 없이 실제 음성-시각 데이터셋에서 최신 기술 수준(SOTA) 방법과 비교했을 때, 제안된 AVCA 모델은 일반화된 제로샷 학습(GZSL)에서 어떤 성능을 보이는가?
  • RQ4단모달 정보를 유지하는 정규화 손실을 포함할 경우, 다중모달 ZSL 모델의 강인성과 성능 향상 정도는 어느 정도인가?
  • RQ5VGGSound, UCF101, ActivityNet과 같은 기존 데이터셋을 기반으로, 학습 및 테스트 세트 간 데이터 泄漏가 없는 현실적인 평가 조건을 확보할 수 있는 통합된 음성-시각 GZSL 벤치마크를 구성할 수 있는가?

주요 결과

  • VGGSound-GZSL 벤치마크에서 AVCA는 조화 평균(HM) 6.31%와 제로샷 학습(ZSL) 정확도 6.00%를 기록하였으며, AVGZSLNet(HM: 5.83%, ZSL: 5.28%) 및 DEVISE(HM: 5.00%, ZSL: 4.50%)를 모두 앞서며 성능을 뛰어넘었다.
  • UCF-GZSL에서 AVCA는 HM: 27.15%와 ZSL: 20.01%를 달성하였으며, AVGZSLNet(HM: 18.05%, ZSL: 13.65%) 및 DEVISE(HM: 15.00%, ZSL: 12.00%)를 압도적으로 앞서는 성능을 보였다.
  • ActivityNet-GZSL에서 AVCA는 HM: 12.13%와 ZSL: 9.13%를 기록하였으며, AVGZSLNet(HM: 8.30%, ZSL: 6.39%) 및 DEVISE(HM: 7.00%, ZSL: 5.50%)보다 뚜렷한 성능 향상을 보였다.
  • 제거 실험 결과, 교차어텐션을 제거할 경우 성능 저하가 발생하며, $l_c$ 손실과 교차어텐션을 추가함으로써 AVGZSLNet 대비 성능 향상이 확인되어 제안된 구성 요소의 효과를 입증하였다.
  • 음성 및 시각 브랜치를 모두 사용할 경우, 단일 모달만 사용하는 경우보다 더 높은 본래 클래스(S) 및 미사용 클래스(U) 성능을 기록하였으며, ActivityNet-GZSL에서 HM은 7.53%(시각 전용)에서 12.13%로 증가하였다.
  • AVCA는 1.69M 파라미터와 2.36 GFLOPS를 가지며, AVGZSLNet(1.32M 파라미터, 1.38 GFLOPS)와 유사한 계산 효율성을 확보하면서도, 모든 벤치마크에서 뚜렷한 성능 향상을 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.