[論文レビュー] Image Hijacks: Adversarial Images can Control Generative Models at Runtime
本稿では、推論時における視覚言語モデル(VLM)の生成出力を操作するための、人間が認識できないアドバーシャル画像「image hijacks」を紹介する。著者らは、行動マッチング(Behaviour Matching)と呼ばれる新規手法を用い、LLaVA(CLIPおよびLLaMA-2に基づく最先端のVLM)において、任意のテキスト出力を強制したり、文脈を漏洩させたり、セーフティ対策を回避したりする目的で、人間には感知できない画像の摂動を生成した。その成功率は90%以上に達した。
Are foundation models secure against malicious actors? In this work, we focus on the image input to a vision-language model (VLM). We discover image hijacks, adversarial images that control the behaviour of VLMs at inference time, and introduce the general Behaviour Matching algorithm for training image hijacks. From this, we derive the Prompt Matching method, allowing us to train hijacks matching the behaviour of an arbitrary user-defined text prompt (e.g. 'the Eiffel Tower is now located in Rome') using a generic, off-the-shelf dataset unrelated to our choice of prompt. We use Behaviour Matching to craft hijacks for four types of attack, forcing VLMs to generate outputs of the adversary's choice, leak information from their context window, override their safety training, and believe false statements. We study these attacks against LLaVA, a state-of-the-art VLM based on CLIP and LLaMA-2, and find that all attack types achieve a success rate of over 80%. Moreover, our attacks are automated and require only small image perturbations.
研究の動機と目的
- 信頼できない画像入力が、推論時における視覚言語モデル(VLM)の挙動を乗っ取れるかどうかを調査すること。
- VLMの出力を微細に制御できる、一般化可能で自動化されたアドバーシャル画像生成手法を開発すること。
- さまざまな摂動制約下での攻撃の頑健性と現実世界での実現可能性を評価すること。
- 画像ハイジャックがセーフティトレーニングを回避し、有害または意図しない出力を強制できるかどうかを実証すること。
- マルチモodal基盤モデルの現実世界への導入におけるセキュリティリスクへの意識喚起
提案手法
- 入力テキストにかかわらず、VLMの出力を望ましい行動に一致させるように画像摂動を最適化する、訓練フレームワーク「Behaviour Matching」を提案する。
- 画像空間における勾配降下法を用いて、特定の出力行動(例:任意の文字列の生成、セーフティ制約の回避)を標的とする画像ハイジャックを訓練する。
- 現実世界の攻撃シナリオを模倣するため、ℓ∞-ノルム制限、ステーショナリーパッチ、モービングパッチの3つの異なる摂動制約下で手法を適用する。
- 攻撃者がVLMのアーキテクチャとパラメータに完全にアクセス可能なホワイトボックス攻撃モデルを採用し、頑健な攻撃を生成する。
- 標的行動を、特定の文字列の出力(特定文字列攻撃)、繰り返しの文脈(文脈漏洩攻撃)、有害な指示への準拠(ジェイルブレイク攻撃)として定義する。
- VLMのアテンションメカニズムを活用し、テキストプロンプトが変化しても、あるいは敵対的であっても、画像入力がモデル出力を支配することを保証する。

実験結果
リサーチクエスチョン
- RQ1入力テキストにかかわらず、アドバーシャル画像を用いて視覚言語モデルの生成出力を推論時において制御可能か?
- RQ2ℓ∞-ノルム、ステーショナリーパッチ、モービングパッチといった異なる摂動制約下での画像ハイジャックの有効性はいかが?
- RQ3画像ハイジャックは、モデルのセーフティトレーニングを回避し、有害または意図しないコンテンツの生成を引き起こせるか?
- RQ4画像ハイジャックは、モデルのコンテキストウインドウ内の情報をどれほど出力に漏洩させられるか?
- RQ5画像ハイジャックは、自動的かつ人間が感知できないものであり、現実世界の環境でも実用的かつ頑健な脅威として成立するか?
主な発見
- LLaVA LLaMA-2-13B-Chatモデルにおいて、特定文字列攻撃、文脈漏洩攻撃、ジェイルブレイク攻撃の3つの攻撃タイプすべてで、90%を超える成功率を達成した。
- 攻撃は自動化されており、人間が感知できない小さなℓ∞-ノルム摂動(例:16/255)で十分であるため、人間には見えない。
- 行動マッチング手法により、入力テキストプロンプトの変化に関係なく、モデル出力に対する一貫した制御が可能である、頑健な画像ハイジャックが生成された。
- 文脈漏洩攻撃では、VLMが入力コンテキストをAPIコールで包んで繰り返すことを強制し、新たな形の情報漏洩を示した。
- ステーショナリーパッチおよびモービングパッチの制約下でも攻撃が有効であるため、動的または制限付きの入力環境において現実世界での実現可能性が裏付けられた。
- 本研究では、現在のアドバーシャル頑健性対策が、このような攻撃に対してはほとんど防御効果を示さないことが示された。これにより、画像ハイジャックが今後数年間、持続的な脅威である可能性が浮き彫りになった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。