Skip to main content
QUICK REVIEW

[論文レビュー] Backdoor Attacks to Pre-trained Unified Foundation Models

Zenghui Yuan, Yixin Liu|arXiv (Cornell University)|Feb 18, 2023
Adversarial Robustness in Machine Learning被引用数 4
ひとこと要約

本論文は、データ汚染を用いたバックドア攻撃に関して、事前学習済み統合基盤モデルに対する最初の概念実証研究を提示している。マルチモーダルモデル(OFA-tiny)において、視覚タスクで96.34%の攻撃成功率、自然言語処理(NLP)で100%の攻撃成功率を達成しながらも、クリーンな精度を高い水準に維持した。これは、統合AIシステムにおける深刻な脆弱性を明らかにしている。

ABSTRACT

The rise of pre-trained unified foundation models breaks down the barriers between different modalities and tasks, providing comprehensive support to users with unified architectures. However, the backdoor attack on pre-trained models poses a serious threat to their security. Previous research on backdoor attacks has been limited to uni-modal tasks or single tasks across modalities, making it inapplicable to unified foundation models. In this paper, we make proof-of-concept level research on the backdoor attack for pre-trained unified foundation models. Through preliminary experiments on NLP and CV classification tasks, we reveal the vulnerability of these models and suggest future research directions for enhancing the attack approach.

研究の動機と目的

  • 統合基盤モデルが複数のモダリティおよびタスクにわたってバックドア攻撃に対してどれほど脆弱であるかを調査すること。
  • データ汚染が、視覚および自然言語処理タスクに一般化するバックドアを事前学習済みモデルに効果的に埋め込むことができるかどうかを検討すること。
  • 下流の微調整に特化した知識がなくても、持続可能なユニバーサルバックドア攻撃の実現可能性を評価すること。
  • 異種のモダリティ間で、トリガーデザインとその有効性に関する主な課題を特定すること。
  • 統合基盤モデルにおけるユニバーサルバックドア攻撃および防御に関する今後の研究の基盤を築くこと。

提案手法

  • 事前学習段階で、データ汚染パラダイムを活用して、事前学習済み統合基盤モデルにバックドアを埋め込む。
  • 視覚とNLP用の混合トリガーを設計:視覚タスクでは「Hello Kitty」の画像を20%のアルファ比でブレンドし、右下隅に赤い四角形を貼り付ける。NLPタスクでは、稀な文字「cf」をトリガーとして挿入する。
  • 画像分類およびテキスト分類タスクの両方で、OFA-tinyモデルをベンチマークとして用いる。
  • 汚染済みデータを用いた標準的なOFAトレーニングパイプラインを適用し、トリガーを訓練データに埋め込み、モデルがトリガーとターゲットラベルを関連付けるように学習させる。
  • モデルの性能を評価するために、クリーン精度(CA)と攻撃成功確率(ASR)を評価指標として用いる。
  • 汚染率ρ = 0.2の条件下で、CIFAR-10(視覚)およびSST-2(NLP)データセットを用いて実験を実施する。

実験結果

リサーチクエスチョン

  • RQ1データ汚染を用いたバックドア攻撃が、複数のモダリティおよびタスクをサポートする統合基盤モデルに対して、効果的に実行可能であるか?
  • RQ2視覚(ブレンド対貼り付け)およびNLP(文字挿入)における異なるトリガータイプが、複数のモダリティで高い攻撃成功確率を達成するのにどれほど有効であるか?
  • RQ3クリーン入力に対する性能を維持しつつ、バックドアを検出されにくく隠すことはどの程度可能か?
  • RQ4下流のタスクやモダリティに特化した調整なしに、1つのバックドアトリガーが多様なタスクで効果を発揮できるか?
  • RQ5統合基盤モデルに向けたユニバーサルトリガーを設計するにあたり、主な課題は何か?

主な発見

  • バックドアの埋め込み後も、クリーン精度はほとんど変化せず、CIFAR-10では91.35%、SST-2では91.68%を示し、通常の機能への影響は最小限であることが示された。
  • ブレンドベースのトリガーは、CIFAR-10データセットで96.34%の攻撃成功確率(ASR)を達成し、視覚タスクにおける高い有効性を示した。
  • 貼り付けベースのトリガーは、CIFAR-10で85.13%のASRにとどまり、データ拡張がトリガーを曇らせるまたは劣化させる可能性があることを示唆した。
  • SST-2を用いたNLPタスクでは、攻撃が完璧な100%のASRを達成した。これは、「cf」文字トリガーがテキスト入力において極めて有効であることを示している。
  • 結果から、統合基盤モデルは、下流タスクやモダリティの知識がなくても、ユニバーサルバックドア攻撃に対して脆弱であることが確認された。
  • 本研究は、トリガーデザインとデータ拡張に対する耐性が、攻撃成功に大きく影響する重要な要因であることを明らかにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。