Skip to main content
QUICK REVIEW

[論文レビュー] Cross-modal Prompts: Adapting Large Pre-trained Models for Audio-Visual Downstream Tasks

Haoyi Duan, Yan Xia|arXiv (Cornell University)|Nov 9, 2023
Speech and Audio Processing被引用数 7
ひとこと要約

本論文では、音声および視覚モodalをソフトプロンプトとして用い、固定された事前学習済み音声・視覚エンコーダーにおける特徴抽出を能動的に最適化する、デュアルガイドド・スパティアル・チャンネル・テンポラル(DG-SCT)アテンションメカニズムを提案する。ViTおよびHTS-ATモデルの各層にトレーニング可能なクロスモーダル相互作用層を統合することで、空間的・チャネル的・時間的次元において特徴の統合を強化し、AVE、AVVP、AVS、AVQAの各ベンチマークで最先端の性能を達成した。特に、少サンプルおよびゼロショット一般化性能においても優れた結果を示した。

ABSTRACT

In recent years, the deployment of large-scale pre-trained models in audio-visual downstream tasks has yielded remarkable outcomes. However, these models, primarily trained on single-modality unconstrained datasets, still encounter challenges in feature extraction for multi-modal tasks, leading to suboptimal performance. This limitation arises due to the introduction of irrelevant modality-specific information during encoding, which adversely affects the performance of downstream tasks. To address this challenge, this paper proposes a novel Dual-Guided Spatial-Channel-Temporal (DG-SCT) attention mechanism. This mechanism leverages audio and visual modalities as soft prompts to dynamically adjust the parameters of pre-trained models based on the current multi-modal input features. Specifically, the DG-SCT module incorporates trainable cross-modal interaction layers into pre-trained audio-visual encoders, allowing adaptive extraction of crucial information from the current modality across spatial, channel, and temporal dimensions, while preserving the frozen parameters of large-scale pre-trained models. Experimental evaluations demonstrate that our proposed model achieves state-of-the-art results across multiple downstream tasks, including AVE, AVVP, AVS, and AVQA. Furthermore, our model exhibits promising performance in challenging few-shot and zero-shot scenarios. The source code and pre-trained models are available at https://github.com/haoyi-duan/DG-SCT.

研究の動機と目的

  • 関連のないモダリティ固有の特徴抽出に起因する、単一モダリティの事前学習済みモデルがマルチモーダル音声・視覚タスクで性能を発揮しない問題に対処する。
  • 主にテキスト・イメージプロンプトに焦点を当てた従来のCLIPベースの手法の制限を克服し、音声・視覚シナリオにまでプロンプト学習を拡張する。
  • 一方のモダリティをもう一方のモダリティの表現学習をガイドするソフトプロンプトとして用いることで、双方向的かつ適応的な特徴精錬を可能にする。
  • 大規模な事前学習モデルの重みを固定したまま、下流タスクへの適応に最小限かつ効率的なトレーニング可能なコンponentsを導入する。
  • 空間的・チャネル的・時間的次元におけるマルチレベルアテンション機構を通じて、モダリティ間の特徴のコンパクト性と識別性を向上させる。

提案手法

  • 固定された事前学習済み音声および視覚エンコーダーの各層に、トレーニング可能なクロスモーダル相互作用層を統合するDG-SCTアテンションメカニズムを導入する。
  • 音声および視覚特徴をソフトプロンプトとして用い、相手モダリティの空間的・チャネル的・時間的次元におけるアテンション重みを動的に調整する。
  • 2次元畳み込みおよび線形投影を用いて、音声および視覚プロンプトの次元を一致させ、一貫性のある特徴相互作用を確保する。
  • 双方向的ガイドランスを実装:音声プロンプトが視覚特徴抽出をガイドし、逆に視覚プロンプトが音声特徴抽出をガイドすることで、相互に表現を精錬する。
  • 大規模モデル(例:ViT、Swin-T、HTS-AT)の元の重みを固定したまま、軽量なDG-SCTモジュールのみを微調整する。
  • エンコーダーの複数の層にDG-SCTを統合することで、階層的かつ多スケールの特徴適応を可能にする。

実験結果

リサーチクエスチョン

  • RQ1音声および視覚モダリティが、音声・視覚タスクにおける事前学習モデルの特徴抽出をガイドする有効なソフトプロンプトとして機能するか?
  • RQ2空間的・チャネル的・時間的次元における双方向的クロスモーダルアテンションは、単方向的またはプロンプトなしの手法と比較して、特徴品質および下流タスク性能を向上させるか?
  • RQ3提案されたDG-SCTメカニズムは、少サンプルおよびゼロショット設定を含む多様な音声・視覚ベンチマークで最先端の性能を達成できるか?
  • RQ4空間的・チャネル的・時間的次元におけるマルチレベルアテンションの導入が、学習された特徴の識別力にどのように寄与するか?
  • RQ5ベースラインと比較して、DG-SCTは表現空間における特徴のコンパクト性およびクラス間分離性をどの程度向上させるか?

主な発見

  • DG-SCTは4つの主要な音声・視覚ベンチマーク(AVE:82.2%の正確度、AVVP:89.2%、AVS:64.2%、AVQA:70.7%)で最先端の性能を達成した。
  • AVEベンチマークでは82.2%の正確度を達成し、以前の最先端手法(CMBS)を2.9ポイント、LAVisHを2.5ポイント上回った。
  • 少サンプルおよびゼロショット設定でも、限られたラベル付きデータでも高い性能を維持する優れた一般化性能を示した。
  • t-SNE可視化により、DG-SCTが音声および視覚モダリティ間でよりクラス内にコンパクトでクラス間で分離性の高い特徴を学習していることが確認された。
  • トレーニング可能なパラメータが4360万個にとどまり、LAVisHと比較してわずかに増加した一方で、正確度において顕著に優れた性能を発揮した。
  • アブレーションスタディにより、空間的・チャネル的・時間的アテンションの3つのコンponentsがすべて最終性能に顕著な寄与をしていることが確認され、完全なDG-SCTモジュールが最良の結果をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。