Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-modal Prompts: Adapting Large Pre-trained Models for Audio-Visual Downstream Tasks

Haoyi Duan, Yan Xia|arXiv (Cornell University)|2023. 11. 09.
Speech and Audio Processing인용 수 7
한 줄 요약

이 논문은 고정된 사전 훈련된 오디오-비주얼 인코더에서 특징 추출을 적응적으로 개선하기 위해 음성과 시각 모odalities를 소프트 프롬프트로 사용하는 이중 가로형 공간-채널-시간 주의 메커니즘인 DG-SCT를 제안한다. ViT 및 HTS-AT 모델에 훈련 가능한 다중모odal 상호작용 레이어를 통합함으로써 DG-SCT는 공간, 채널, 시간 차원을 넘어서 특징 융합을 향상시켜 AVE, AVVP, AVS, AVQA에서 최신 기술 수준(SOTA)의 성능을 달성하였으며, 소수의 샘플 및 제로샷 일반화 능력 또한 뛰어나다.

ABSTRACT

In recent years, the deployment of large-scale pre-trained models in audio-visual downstream tasks has yielded remarkable outcomes. However, these models, primarily trained on single-modality unconstrained datasets, still encounter challenges in feature extraction for multi-modal tasks, leading to suboptimal performance. This limitation arises due to the introduction of irrelevant modality-specific information during encoding, which adversely affects the performance of downstream tasks. To address this challenge, this paper proposes a novel Dual-Guided Spatial-Channel-Temporal (DG-SCT) attention mechanism. This mechanism leverages audio and visual modalities as soft prompts to dynamically adjust the parameters of pre-trained models based on the current multi-modal input features. Specifically, the DG-SCT module incorporates trainable cross-modal interaction layers into pre-trained audio-visual encoders, allowing adaptive extraction of crucial information from the current modality across spatial, channel, and temporal dimensions, while preserving the frozen parameters of large-scale pre-trained models. Experimental evaluations demonstrate that our proposed model achieves state-of-the-art results across multiple downstream tasks, including AVE, AVVP, AVS, and AVQA. Furthermore, our model exhibits promising performance in challenging few-shot and zero-shot scenarios. The source code and pre-trained models are available at https://github.com/haoyi-duan/DG-SCT.

연구 동기 및 목표

  • 모달 특화된 특징 추출이 불필요한 데서 기인하는 단모달 사전 훈련 모델의 다모달 오디오-비주얼 작업에서의 열악한 성능을 해결하기 위해.
  • 기존의 CLIP 기반 방법이 주로 텍스트-이미지 프롬프트에 집중하는 데에 한계가 있음을 극복하고, 오디오-비주얼 환경으로 프롬프트 학습을 확장하기 위해.
  • 각 모달을 소프트 프롬프트로 사용하여 상호 작용하는 방식으로 양방향적이고 적응적인 특징 개선을 가능하게 하기 위해.
  • 대규모 사전 훈련 모델의 고정된 파라미터를 유지하면서도 하류 작업에 적응하기 위해 최소한의 효율적인 훈련 가능한 구성 요소를 도입하기 위해.
  • 공간, 채널, 시간 차원에서의 다중 수준 주의 메커니즘을 통해 다양한 모달 간의 특징 밀도 및 구분 능력을 향상시키기 위해.

제안 방법

  • 고정된 사전 훈련된 오디오 및 시각 인코더의 각 레이어에 훈련 가능한 다중모달 상호작용 레이어를 통합하는 DG-SCT 주의 메커니즘을 도입한다.
  • 오디오 및 시각 특징을 소프트 프롬프트로 활용하여 상대 모달의 공간, 채널, 시간 차원에서의 주의 가중치를 동적으로 조정한다.
  • 오디오 및 시각 프롬프트의 차원을 일치시키기 위해 2차원 컨볼루션과 선형 투영을 적용하여 일관된 특징 상호작용을 보장한다.
  • 양방향 가이드라인을 구현: 오디오 프롬프트가 시각 특징 추출을 지시하고, 반대로 시각 프롬프트가 오디오 특징 추출을 지시함으로써 상호 보완적인 표현 학습을 가능하게 한다.
  • 대규모 모델의 원본 고정 가중치(예: ViT, Swin-T, HTS-AT)를 유지하면서 오직 경량 DG-SCT 모듈만을 미세조정한다.
  • 인코더의 여러 레이어에 DG-SCT를 통합하여 계층적이고 다중 해상도의 특징 적응을 가능하게 한다.

실험 결과

연구 질문

  • RQ1오디오 및 시각 모달이 사전 훈련된 모델에서 오디오-비주얼 작업을 위한 특징 추출을 지도하기 위해 효과적인 소프트 프롬프트로 기능할 수 있는가?
  • RQ2공간, 채널, 시간 차원에서의 이중 주의 메커니즘은 단방향 또는 무프롬프트 설정에 비해 특징 품질과 하류 작업 성능을 향상시키는가?
  • RQ3제안된 DG-SCT 메커니즘이 소수의 샘플 및 제로샷 설정을 포함한 다양한 오디오-비주얼 벤치마크에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ4공간, 채널, 시간 차원의 다중 수준 주의 메커니즘이 학습된 특징의 구분 능력에 어떤 기여를 하는가?
  • RQ5기존 기준 모델 대비 DG-SCT는 표현 공간에서 특징의 밀도 및 클래스 간 분리도를 얼마나 향상시키는가?

주요 결과

  • DG-SCT는 AVE(82.2% 정확도), AVVP(89.2%), AVS(64.2%), AVQA(70.7%)를 포함한 네 가지 주요 오디오-비주얼 벤치마크에서 최신 기술 수준의 성능을 달성하였다.
  • AVE 벤치마크에서 82.2%의 정확도를 기록하여 이전 최고 성능 모델(CMBS)보다 2.9%p 높고, LAVisH보다 2.5%p 높았다.
  • 소수의 샘플 및 제로샷 설정에서도 DG-SCT는 뛰어난 일반화 능력을 보이며 제한된 레이블 데이터로도 높은 성능 유지를 보였다.
  • t-SNE 시각화 결과 DG-SCT는 오디오 및 시각 모달 간에 더 높은 내부 클래스 밀도와 더 높은 클래스 간 분리도를 갖는 특징을 학습하는 것으로 확인되었다.
  • 훈련 가능한 파라미터 수가 4360만 개에 불과하여 LAVisH 대비 약간의 증가만을 보였지만, 정확도에서 뚜렷한 승리를 거두었다.
  • 제거 실험 결과, 공간, 채널, 시간 주의 모두가 최종 성능에 기여하며, 전체 DG-SCT 모듈이 가장 우수한 성능을 내는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.