Skip to main content
QUICK REVIEW

[論文レビュー] Misusing Tools in Large Language Models With Visual Adversarial Examples

Xiaohan Fu, Zihan Wang|arXiv (Cornell University)|Oct 4, 2023
Adversarial Robustness in Machine Learning被引用数 6
ひとこと要約

本稿では、人間が感知できない視覚的摂動を用いて、マルチモーダル大規模言語モデル(LLMs)を操作し、メールの削除やホテルの予約といった悪意あるツール呼び出しを引き起こす、ホワイトボックス型の画像ベースの対人攻撃を提案する。この攻撃は、多様なプロンプトにおいて攻撃者指定のツール使用を誘発する際、ほぼ完璧な成功率(約98%)を達成し、高い画像類似度(SSIM 約0.9)を維持しながら自然な会話の流れを保っているため、高い隠蔽性と一般化能を示している。

ABSTRACT

Large Language Models (LLMs) are being enhanced with the ability to use tools and to process multiple modalities. These new capabilities bring new benefits and also new security risks. In this work, we show that an attacker can use visual adversarial examples to cause attacker-desired tool usage. For example, the attacker could cause a victim LLM to delete calendar events, leak private conversations and book hotels. Different from prior work, our attacks can affect the confidentiality and integrity of user resources connected to the LLM while being stealthy and generalizable to multiple input prompts. We construct these attacks using gradient-based adversarial training and characterize performance along multiple dimensions. We find that our adversarial images can manipulate the LLM to invoke tools following real-world syntax almost always (~98%) while maintaining high similarity to clean images (~0.9 SSIM). Furthermore, using human scoring and automated metrics, we find that the attacks do not noticeably affect the conversation (and its semantics) between the user and the LLM.

研究の動機と目的

  • ツール機能と視覚能力を備えたマルチモーダル LLM におけるセキュリティギャップに取り組むこと。これらのモデルは、ユーザー資産の整合性と機密性を損なう攻撃に対して脆弱である。
  • 人間が感知できない画像摂動を用いるが、特定の入力に限定されない、多様なユーザーのプロンプトに一般化可能な攻撃を開発すること。
  • 自然言語でない複雑なツール構文(例:API コール)の呼び出しを誘発するが、ユーザーと LLM 間の会話の流れを損なわないこと。
  • 現在の LLM アライメント定義に内在する重大な不一致脆弱性を浮き彫りにすること。これは、広範な人間の価値に焦点を当てるが、ユーザーおよびタスク固有のセキュリティリスクを無視している。
  • オープンウェイトのマルチモーダル LLM が広く展開される前に、ツールアクセスに対する厳密な承認制御などの予防的セキュリティ対策を推奨すること。

提案手法

  • 攻撃は勾配ベースの adversarial 訓練を用い、人間には感知できない摂動を生成することで、LLM が攻撃者制御の特定のツール呼び出し構文を生成するように誘導する。
  • 攻撃はホワイトボックス設定で実行され、モデルパラメータへのアクセスを必要とし、多様な入力プロンプトにおいて望ましいツールコールを誘発する高成功率を最適化する。
  • LLM の会話出力の自然さと整合性を維持するため、応答の有用性損失項(response utility loss term)を導入し、攻撃の隠蔽性を確保する。
  • 攻撃はドメイン内およびドメイン外のプロンプトの両方で評価され、特定の画像文脈を超えて一般化できることを示している。
  • 画像類似度と会話品質の両面で、自動指標(SSIM、損失)と人間評価を用いてアタックの妥当性を検証した。
  • 攻撃はメール削除、メール送信、ホテル予約など、構文の複雑さが異なる複数のツールタイプに適用可能である。

実験結果

リサーチクエスチョン

  • RQ1視覚的 adversarial 例を用いて、マルチモーダル LLM を、高成功率と高隠蔽性で攻撃者指定の複雑なツールコールに誘導できるか?
  • RQ2攻撃は、画像内容とは関係のないプロンプトに対しても、どの程度一般化されるか?
  • RQ3悪意あるツール使用を誘発しても、LLM の会話応答の自然さと有用性はどの程度保持されるか?
  • RQ4攻撃成功率と摂動の隠蔽性のトレードオフは何か?また、異なる脅威モデルに適合させるために調整可能か?
  • RQ5攻撃はドメイン外の例に対しても効果を示すか?また、未確認の入力に対しても効果的に転送可能か?

主な発見

  • 攻撃は画像関連のプロンプトにおいて、約98%の成功率で望ましいツールコールを誘発した。一方、関連のないプロンプトでは、約60–70%に低下したが、依然として強い一般化能を示した。
  • adversarial 画像とクリーン画像間の平均 SSIM は約0.9であり、高い視覚的類似度と強力な隠蔽性を確認した。
  • 応答の有用性損失指標では、クリーンモデルの生成物と比較して約10%の低下にとどまり、会話品質への劣化は最小限に抑えられた。
  • 攻撃はドメイン外のテストセットに対しても効果的に一般化され、異なるツールタイプや未確認のプロンプトにおいても高い成功率(例:66–98%)を維持した。
  • 攻撃は、API レベルでの正確なフォーマットが求められる「send_email_hard」バージョンのように、構文が複雑または自然でない場合でも効果を示した。
  • 人間評価では、LLM が悪意ある行動をとっているにもかかわらず、会話が自然で悪意ある行動と区別がつかないことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。