[論文レビュー] Data Poisoning Attacks Against Multimodal Encoders
本論文は、マルチモodalエンコーダーに対するデータ汚染攻撃の包括的かつ初の研究を提示する。視覚的および言語的モダリティを同時に標的とする3種類の攻撃を提案し、高い成功率を達成している(例:Flickr-PASCALデータセットにおいて「sheep」のテキストを飛行機の画像に誤ってルーティングする際のトップ5正解率が91.8%)。また、モデルの有用性を保ちながら効果的な攻撃を緩和する、新たな事前学習および事後学習防御手法を提案している。
Recently, the newly emerged multimodal models, which leverage both visual and linguistic modalities to train powerful encoders, have gained increasing attention. However, learning from a large-scale unlabeled dataset also exposes the model to the risk of potential poisoning attacks, whereby the adversary aims to perturb the model's training data to trigger malicious behaviors in it. In contrast to previous work, only poisoning visual modality, in this work, we take the first step to studying poisoning attacks against multimodal models in both visual and linguistic modalities. Specially, we focus on answering two questions: (1) Is the linguistic modality also vulnerable to poisoning attacks? and (2) Which modality is most vulnerable? To answer the two questions, we propose three types of poisoning attacks against multimodal models. Extensive evaluations on different datasets and model architectures show that all three attacks can achieve significant attack performance while maintaining model utility in both visual and linguistic modalities. Furthermore, we observe that the poisoning effect differs between different modalities. To mitigate the attacks, we propose both pre-training and post-training defenses. We empirically show that both defenses can significantly reduce the attack performance while preserving the model's utility.
研究の動機と目的
- マルチモダリティモデルにおける言語的モダリティがデータ汚染攻撃に対して脆弱であるかどうかを調査すること。
- 汚染攻撃に対して、視覚的モダリティと言語的モダリティの相対的な脆弱性を比較すること。
- マルチモダリティ学習システムにおける汚染攻撃に対処する効果的な防御を開発すること。
- 多様なデータセットおよびモデルアーキテクチャを対象に、攻撃および防御のパフォーマンスを評価すること。
- 汚染攻撃が視覚的および言語的エンコーダーに異なる影響を及ぼすかどうかを実証すること。
提案手法
- 対照学習に基づくマルチモダリティモデルにおける視覚的および言語的エンコーダーを標的にする3種類の汚染攻撃を提案する。
- 訓練データに汚染されたサンプルを埋め込み、テキストと画像の埋め込みを標的クラスに向けて不整合にすることを目的とする攻撃を設計する。
- テキストおよび画像エンコーダーをペアデータ上で共同で学習させる二重ブランチ型対照学習フレームワークを採用する。
- 汚染されたモダリティ間の整合性を破壊するために、綺麗なデータでモデルを再学習することで事前学習防御を実装する。
- 適切に選ばれた学習率を用いて、綺麗なデータで微調整することで、事後学習防御を適用する。これにより、攻撃に起因するバイアスを消去する。
- Flickr-PASCALおよびCOCOなどのデータセットで、検索タスクにおけるHit@K、MinRank、正解率などの指標を用いて攻撃の成功度を評価する。
実験結果
リサーチクエスチョン
- RQ1言語的モダリティも視覚的モダリティと同様に、マルチモダリティモデルにおけるデータ汚染攻撃に対して脆弱であるか?
- RQ2攻撃の成功率および影響度の観点から、視覚的モダリティと言語的モダリティのどちらがより汚染攻撃に対して感受性が強いのか?
- RQ3汚染攻撃は視覚的および言語的エンコーダーのパフォーマンスにどのように異なる影響を及ぼすか?
- RQ4事前学習および事後学習防御は、モデルの有用性を著しく低下させることなく、汚染攻撃を効果的に緩和できるか?
- RQ5どのハイパーパrameter(例:学習率、微調整エポック数)が防御の有効性に最も顕著な影響を与えるか?
主な発見
- 提案された汚染攻撃は、Flickr-PASCALデータセットにおいて「sheep」のテキストを飛行機の画像に誤ってルーティングするタスクで、トップ5検索正解率が0.918に達する。
- 視覚的モダリティを汚染すると、MinRankが著しく向上する(例:攻撃IIでは2.192)。これは、標的画像との整合性が高まっていることを示している。
- 言語的モダリティを汚染すると、Hit@1およびHit@5スコアが上昇する(例:0.280および0.864)。これは、即時の検索バイアスが強いことを示している。
- 事後学習防御により、10^-5の学習率で微調整した場合、Hit@10のパフォーマンスが0.936から0.008に低下し、強力な緩和効果が確認された。
- 事前学習防御は、微調整の前段階で汚染されたモダリティ間の整合性を効果的に破壊し、攻撃の成功率を低下させる。
- 防御はわずか1エポックの微調整でも有効であり、最初の50バッチでパフォーマンスが急激に低下する(Hit@10が0.936から0.032に低下)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。