Skip to main content
QUICK REVIEW

[论文解读] Cross-modal Prompts: Adapting Large Pre-trained Models for Audio-Visual Downstream Tasks

Haoyi Duan, Yan Xia|arXiv (Cornell University)|Nov 9, 2023
Speech and Audio Processing被引用 7
一句话总结

本论文提出DG-SCT,一种双路引导的空间-通道-时间注意力机制,利用音频和视觉模态作为软提示,自适应地优化冻结的预训练音视频编码器中的特征提取。通过在ViT和HTS-AT模型的每一层中注入可训练的跨模态交互层,DG-SCT在空间、通道和时间维度上增强了特征融合,实现了在AVE、AVVP、AVS和AVQA数据集上的最先进性能,包括强大的少样本和零样本泛化能力。

ABSTRACT

In recent years, the deployment of large-scale pre-trained models in audio-visual downstream tasks has yielded remarkable outcomes. However, these models, primarily trained on single-modality unconstrained datasets, still encounter challenges in feature extraction for multi-modal tasks, leading to suboptimal performance. This limitation arises due to the introduction of irrelevant modality-specific information during encoding, which adversely affects the performance of downstream tasks. To address this challenge, this paper proposes a novel Dual-Guided Spatial-Channel-Temporal (DG-SCT) attention mechanism. This mechanism leverages audio and visual modalities as soft prompts to dynamically adjust the parameters of pre-trained models based on the current multi-modal input features. Specifically, the DG-SCT module incorporates trainable cross-modal interaction layers into pre-trained audio-visual encoders, allowing adaptive extraction of crucial information from the current modality across spatial, channel, and temporal dimensions, while preserving the frozen parameters of large-scale pre-trained models. Experimental evaluations demonstrate that our proposed model achieves state-of-the-art results across multiple downstream tasks, including AVE, AVVP, AVS, and AVQA. Furthermore, our model exhibits promising performance in challenging few-shot and zero-shot scenarios. The source code and pre-trained models are available at https://github.com/haoyi-duan/DG-SCT.

研究动机与目标

  • 解决单模态预训练模型在多模态音视频任务中因无关模态特异性特征提取而导致的性能不佳问题。
  • 克服现有基于CLIP的方法主要聚焦于文本-图像提示的局限性,将提示学习扩展至音视频场景。
  • 通过将每种模态作为软提示来引导另一种模态的表示学习,实现双向、自适应的特征优化。
  • 在保持大规模预训练模型参数冻结的同时,仅引入少量且高效的可训练组件以实现下游适应。
  • 通过在空间、通道和时间维度上的多层次注意力机制,提升模态间特征的紧凑性和判别性。

提出的方法

  • 提出DG-SCT注意力机制,将可训练的跨模态交互层注入到冻结的预训练音视频编码器的每一层中。
  • 利用音频和视觉特征作为软提示,动态调整另一模态在空间、通道和时间维度上的注意力权重。
  • 应用2D卷积和线性投影对齐音频和视觉提示的维度,确保一致的特征交互。
  • 实施双向引导:音频提示引导视觉特征提取,反之亦然,实现表示的相互优化。
  • 保持大规模模型(如ViT、Swin-T、HTS-AT)原始冻结权重,仅微调轻量级DG-SCT模块。
  • 在编码器的多个层级集成DG-SCT,以实现分层的、多粒度的特征自适应。

实验结果

研究问题

  • RQ1音频和视觉模态能否作为有效软提示,引导预训练模型在音视频任务中的特征提取?
  • RQ2与单向或无提示方法相比,跨空间、通道和时间维度的双向跨模态注意力是否能提升特征质量和下游性能?
  • RQ3所提出的DG-SCT机制是否能在涵盖少样本和零样本设置的多样化音视频基准上实现最先进性能?
  • RQ4多层次注意力(空间、通道、时间)的引入如何增强学习特征的判别能力?
  • RQ5与基线方法相比,DG-SCT在表示空间中对特征紧凑性和类间可分性的提升程度如何?

主要发现

  • DG-SCT在四个主要音视频基准上达到最先进性能:AVE(82.2%准确率)、AVVP(89.2%)、AVS(64.2%)和AVQA(70.7%)。
  • 在AVE基准上,模型达到82.2%准确率,比之前最先进方法(CMBS)高出2.9个百分点,比LAVisH高出2.5个百分点。
  • 在少样本和零样本设置下,DG-SCT展现出强大的泛化能力,即使在标注数据有限的情况下仍保持高性能。
  • t-SNE可视化结果表明,DG-SCT在音频和视觉模态之间学习到更具类内紧凑性和类间可分性的特征。
  • 模型仅引入4360万参数,相比LAVisH增加量适中,但准确率显著超越其表现。
  • 消融实验证实,空间、通道和时间注意力三个组件均对最终性能有显著贡献,完整DG-SCT模块表现最佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。