[論文レビュー] Are Multimodal Transformers Robust to Missing Modality?
本稿では、マルチモーダルなトランスフォーマーが欠損モダリティに対してどれほど感受性が高いかを調査し、最適な統合戦略がデータセット依存的であることが判明した。これを解決するために、最適な統合層を微分可能に探索するマルチタスク学習フレームワークを提案し、欠損モダリティ下での3つのベンチマークで顕著な性能向上を達成した。
Multimodal data collected from the real world are often imperfect due to missing modalities. Therefore multimodal models that are robust against modal-incomplete data are highly preferred. Recently, Transformer models have shown great success in processing multimodal data. However, existing work has been limited to either architecture designs or pre-training strategies; whether Transformer models are naturally robust against missing-modal data has rarely been investigated. In this paper, we present the first-of-its-kind work to comprehensively investigate the behavior of Transformers in the presence of modal-incomplete data. Unsurprising, we find Transformer models are sensitive to missing modalities while different modal fusion strategies will significantly affect the robustness. What surprised us is that the optimal fusion strategy is dataset dependent even for the same Transformer model; there does not exist a universal strategy that works in general cases. Based on these findings, we propose a principle method to improve the robustness of Transformer models by automatically searching for an optimal fusion strategy regarding input data. Experimental validations on three benchmarks support the superior performance of the proposed method.
研究の動機と目的
- 実世界のデータにおける欠損モダリティに直面したマルチモーダルなトランスフォーマーの耐性を調査すること。
- 欠損モダリティ下でのデータセット間で一般化可能な既存の統合戦略(早期統合、遅延統合、中間統合)が有効かどうかを特定すること。
- 欠損モダリティ下での普遍的な統合戦略の欠如を解消し、データセットの特性に基づいて最適な統合を自動で学習する手法を開発すること。
- 完全データと不完全データの両方に対する共同最適化により、欠損モダリティ下での一般化性能を向上させること。
提案手法
- 完全モダリティと不完全モダリティの両方のデータを同時に学習するマルチタスク学習フレームワークを提案し、耐性を向上させること。
- 最適な統合層の探索を二段階最適化問題として定式化し、統合戦略のエンドツーエンド微分可能学習を可能にすること。
- 推論中に分類トークンが関係のないモダリティに注目するのを防ぐために、モダリティ固有の注目マスクを導入すること。
- 入力サンプルごとに最適な統合層の深さを予測する学習可能なポリシーネットワークを活用し、入力のモダリティ利用可能性に応じて動的に適応すること。
- 完全データにおける交差エントロピー損失と不完全データにおける正則化損失の組み合わせを用いてモデルを訓練し、性能を維持すること。
- 勾配ベース最適化により、統合戦略とモデルパラメータを同時に更新することで、統合構成の効率的探索を可能にすること。
実験結果
リサーチクエスチョン
- RQ1マルチモーダルなトランスフォーマーは、特にテキストモダリティが著しく削減された場合に、欠損モダリティ下でどのように性能を発揮するか、また単モダリティベースラインと比較してどうなるか?
- RQ2欠損モダリティ下でのモデルの耐性に、統合戦略の選択(早期統合、遅延統合、中間統合)が顕著に影響を与えるか?
- RQ3モダリティが欠損している状況下で、異なるデータセットにわたって普遍的な統合戦略が存在するか?
- RQ4不完全データを用いたマルチタスク学習は、標準的な事前学習に比べて耐性向上に有効か?
- RQ5各データセットや入力ごとに最適な統合層を特定するための微分可能探索は、どの程度効果的か?
主な発見
- マルチモーダルなトランスフォーマーはモダリティが欠損すると著しく性能を低下させ、一部のデータセットでは単モダリティベースラインを下回る。特にテキストモダリティが著しく削減された場合に顕著である。
- MM-IMDbとHateful Memesでは、欠損モダリティ下でも早期統合が遅延統合を上回るが、UPMC Food-101では遅延統合が優れている。これは最適な戦略がデータセット依存的であることを裏付けている。
- MM-IMDb(10%テキスト)では46.6のF1-Macroを達成し、新しいベースライン(40.4)と単一画像ベースライン(31.2)を上回り、強力な耐性を示した。
- UPMC Food-101では10%のテキストでの精度が77.5%に達し、新しいベースライン(44.3%)と単一画像ベースライン(65.9%)を上回り、一貫した向上を示した。
- アブレーションスタディにより、マルチタスク学習が統合戦略探索よりも耐性向上に寄与していることが確認され、10%のテキストでのみ利用可能な状況で30%の性能向上が得られた。
- 注目マスクは極めて重要である:MM-IMDbで除去するとF1-Macroは37.3から23.0に低下し、推論中にモダリティの干渉を防ぐために分離が不可欠であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。