[論文レビュー] Cross-Modal Attention Consistency for Video-Audio Unsupervised Learning
本稿では、視覚的および聴覚的モダリティ間の局所的対応関係を強制するために、モダリティ固有の注意マップとクロスモダリティのガイドに従って整列させる、新しい自己教師付き事前学習タスクであるクロスモダリティ注意一貫性(CMAC)を提案する。ピラミッド型の注意メカニズムと、モダリティ内ネガティブ例を含む再設計された対照的損失を活用することで、計算コストを低減しつつ、動画行動認識、リtrieval、聴覚分類のタスクで最先端の性能を達成する。
Cross-modal correlation provides an inherent supervision for video unsupervised representation learning. Existing methods focus on distinguishing different video clips by visual and audio representations. We human visual perception could attend to regions where sounds are made, and our auditory perception could also ground their frequencies of sounding objects, which we call bidirectional local correspondence. Such supervision is intuitive but not well explored in the contrastive learning framework. This paper introduces a pretext task, Cross-Modal Attention Consistency (CMAC), for exploring the bidirectional local correspondence property. The CMAC approach aims to align the regional attention generated purely from the visual signal with the target attention generated under the guidance of acoustic signal, and do a similar alignment for frequency grounding on the acoustic attention. Accompanied by a remoulded cross-modal contrastive loss where we consider additional within-modal interactions, the CMAC approach works effectively for enforcing the bidirectional alignment. Extensive experiments on six downstream benchmarks demonstrate that CMAC can improve the state-of-the-art performance on both visual and audio modalities.
研究の動機と目的
- 動画・聴覚の自己教師付き学習において、局所的対応関係のための細分化された監視信号の欠如を解消すること。
- 視覚的注意が音源を発生させる領域に焦点を当てる一方で、聴覚的注意が顕著な物体に対応する周波数をターゲットとする、双方向の局所的対応関係を、人為的アノテーションなしにモデル化すること。
- モダリティ固有の注意マップとクロスモダリティガイド付き注意マップの間の注意一貫性を強制することで、視覚的および聴覚的表現学習を向上させること。
- 追加のメモリコストなしにモダリティ内相互作用を組み込む、効率的な対照的学習フレームワークを開発すること。
- 計算負荷が低い設定で、下流タスクにおいて最先端の性能を達成すること。
提案手法
- CMACは、1つのモダリティから得られる適応的フィルタを用いて、ピラミッド型の注意メカニズムを導入し、ターゲットとなるクロスモダリティ注意マップを生成する。
- 視覚信号のみから得られる視覚エンコーダーの注意(視覚的信号のみ)を、音声ガイド付きの視覚的注意マップと一致させ、逆に音声側についても同様に処理する。
- 単一モダリティの注意マップとクロスモダリティガイド付き注意マップの間の注意一貫性を強制することで、局所的対応関係を維持する。
- 前回のバッチデータからのモダリティ内ネガティブ例を含む再設計された対照的損失が用いられ、追加のメモリオーバーヘッドを回避する。
- 動的で適応的なフィルタを活用し、モダリティ固有のカーネルを学習することで、異なるモダリティ間での注意マップの整列を実現する。
- データオーグメンテーションを用いた動画・聴覚対照的学習によりエンドツーエンドで訓練し、その後、下流タスクで線形プローブを実施する。
実験結果
リサーチクエスチョン
- RQ1視覚的領域と聴覚的周波数の間の双方向的局所的対応関係が、動画・聴覚表現学習における有効な自己教師信号として機能できるか?
- RQ2人為的アノテーションなしに、視覚的および聴覚的エンコーダーが関連する時空間的および周波数的領域に注目するように、クロスモダリティ注意一貫性をどのようにモデル化できるか?
- RQ3モダリティ固有の注意マップとクロスモダリティガイド付き注意マップの間の注意一貫性を強制することで、インスタンスレベルの対照的学習に比べて下流タスクの性能が向上するか?
- RQ4モダリティ内ネガティブ例を含む再設計された対照的損失は、メモリおよび計算コストを削減しつつ、既存の手法よりも優れた性能を達成できるか?
- RQ5CMACは、行動認識、動画リtrieval、音声分類タスクにおいて、視覚的および聴覚的表現をどの程度向上させるか?
主な発見
- UCF101およびHMDB51の行動認識タスクにおいて、CMACは、GPUコストを6倍も低減し、バッチサイズも小さくしたにもかかわらず、GDTをそれぞれ1.0%および1.1%上回る新たな最先端性能を達成した。
- 動画リtrievalにおいて、CMACはあらゆる設定で新たな最先端結果を達成しており、関連する領域への注意マップ整列のおかげで、より判別力に優れた視覚的表現が得られていることが示された。
- ESC50における音声分類では、CMACは81.4%の精度を達成し、以前の最先端手法(78.6%)を2.8%上回ったが、音声バックボーンのファインチューニングを行わずに行った。
- DCASE2013およびDCASE2014では、それぞれ76%および96%の精度を達成し、後者ではGDTを2%上回った。これは、音声表現学習の向上を示している。
- 視覚的オブジェクトに関連する周波数を局在化することで、CMACは音声表現学習を顕著に向上させた。これは、よりスパarsな、より集中した注意マップによって裏付けられている。
- CMACの有効性は、背景のゴミダミングがある複雑なシーンでも確認されたが、アノテーションなしでは正確な局在化は依然として困難である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。