[論文レビュー] Quantifying and Enhancing Multi-modal Robustness with Modality Preference
本稿では、モダリティの好み(モデルが特定のモダリティに過剰に依存する傾向)を解消することでマルチモーダルモデルのロバスト性を向上させる、新たな訓練手順であるCertifiable Robust Multi-modal Training (CRMT) を提案する。Orthogonal-based正則化と単一モダリティのマージンおよび統合の明示的制御を用いることで、単一モダリティおよびマルチモダリティ攻撃に対して顕著に向上した認証可能ロバスト性を達成し、Kinetics Sounds や VGGS といったベンチマークでも既存手法を上回る性能を示す。
Multi-modal models have shown a promising capability to effectively integrate information from various sources, yet meanwhile, they are found vulnerable to pervasive perturbations, such as uni-modal attacks and missing conditions. To counter these perturbations, robust multi-modal representations are highly expected, which are positioned well away from the discriminative multi-modal decision boundary. In this paper, different from conventional empirical studies, we focus on a commonly used joint multi-modal framework and theoretically discover that larger uni-modal representation margins and more reliable integration for modalities are essential components for achieving higher robustness. This discovery can further explain the limitation of multi-modal robustness and the phenomenon that multi-modal models are often vulnerable to attacks on the specific modality. Moreover, our analysis reveals how the widespread issue, that the model has different preferences for modalities, limits the multi-modal robustness by influencing the essential components and could lead to attacks on the specific modality highly effective. Inspired by our theoretical finding, we introduce a training procedure called Certifiable Robust Multi-modal Training (CRMT), which can alleviate this influence from modality preference and explicitly regulate essential components to significantly improve robustness in a certifiable manner. Our method demonstrates substantial improvements in performance and robustness compared with existing methods. Furthermore, our training procedure can be easily extended to enhance other robust training strategies, highlighting its credibility and flexibility.
研究の動機と目的
- ユニモーダルおよびマルチモーダル摂動に対してロバストなマルチモーダル学習を可能にする基本的要因を特定すること。
- モダリティの好みが存在する場合、なぜマルチモーダルモデルが特定のモダリティに対する攻撃に対して特に脆弱になるのかを解明すること。
- 単一モダリティ表現のマージンとモダリティ統合を明示的に制御することで、認証可能ロバスト性を向上させる訓練手順を開発すること。
- 変換器を含むさまざまなアーキテクチャにおいて、本手法の有効性とスケーラビリティを検証すること。
- モダリティの好みによる不均衡を是正する理論的根拠に基づいた、認証可能なマルチモーダルロバスト性のアプローチを提供すること。
提案手法
- 単一モダリティのマージンとモダリティ統合の相互依存性を分離するためのorthogonalベースのフレームワークを提案し、独立した最適化を可能にする。
- 二段階の訓練手順を導入する:(1) orthogonal射影によるモダリティの好みの正則化により、モダリティの寄与をバランスさせる。 (2) 各モダリティの明示的マージン最大化。
- モデルが防御可能な摂動半径の下界を、単一モダリティのマージンと統合重みから導出する。
- 脆弱性指標 η^(m) を用いてモダリティの不均衡を定量化・監視し、訓練中にモダリティ間の乖離を低減するように誘導する。
- 既存のロバスト訓練戦略にプラグイン形式で適用可能であり、変換器を含むさまざまなアーキテクチャへの拡張を可能にする。
- 評価には FGM および ℓ₂-PGD 攻撃を用い、個々のモダリティおよび統合モダリティにおける摂動下での正確性をロバストネス指標として用いる。
実験結果
リサーチクエスチョン
- RQ1マルチモーダルロバストネスを決定づける本質的理論的要素は何か? また、それらはどのように相互作用するか?
- RQ2なぜマルチモーダルモデルは特定のモダリティに対する攻撃に対してより脆弱になるのか? モダリティの好みがその原因をどのように悪化させるのか?
- RQ3モダリティの好みは単一モダリティのマージンと統合重みのバランスにどのように影響を及ぼすのか? その影響はロバストネスにどのような結果をもたらすか?
- RQ4認証可能ロバストネスを保証する形で、マージンと統合を明示的に制御する訓練手順を設計できるか?
- RQ5CRMTは、変換器のような現代的なアーキテクチャへどの程度拡張可能であり、ロバストネス向上に寄与できるか?
主な発見
- 理論的下界解析により、より大きな単一モダリティ表現のマージンとよりバランスの取れた統合が、より高いマルチモーダルロバストネスを達成するために不可欠であることが示された。
- モダリティの好みは、単一モダリティの脆弱性指標の不均衡を引き起こし、特に図1におけるモダリティ #a において、精度の低下が顕著に顕在される。
- 図4に示すように、CRMTベースの手法は脆弱性指標 (η^(v)/η^(a)) の不均衡を低減し、攻撃タイプや攻撃サイズに関係なく一貫してロバストネスを向上させた。
- Kinetics Sounds データセットにおいて、CRMTはベースラインのJoint Trainingおよび3つのロバスト訓練手法を上回り、特に脆弱なモダリティ #a において顕著な性能向上を示した。
- VGGS における MMT Transformer ベースのモデルに拡張した場合、CRMTはユニモーダルおよびマルチモーダル攻撃の両方において adversarial accuracy を向上させ、スケーラビリティを示した。
- アブレーションスタディにより、CRMTの二段階(好みの正則化とマージン制御)がロバストネス向上に独立して寄与しており、完全な CRMT-JT 法が最良の性能を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。