Skip to main content
QUICK REVIEW

[論文レビュー] Ignore Previous Prompt: Attack Techniques For Language Models

Fábio Perez, Ian Ribeiro|arXiv (Cornell University)|Nov 17, 2022
Adversarial Robustness in Machine Learning被引用数 74
ひとこと要約

この論文は PromptInject というフレームワークを紹介し、LLM へのプロンプト注入攻撃を研究するための2つの攻撃タイプ――ゴール奪取とプロンプト漏洩――を詳述し、さまざまな設定下で GPT-3 ファミリーモデルがこれらの攻撃に対して顕著に脆弱であるという経験的結果を示します。

ABSTRACT

Transformer-based large language models (LLMs) provide a powerful foundation for natural language tasks in large-scale customer-facing applications. However, studies that explore their vulnerabilities emerging from malicious user interaction are scarce. By proposing PromptInject, a prosaic alignment framework for mask-based iterative adversarial prompt composition, we examine how GPT-3, the most widely deployed language model in production, can be easily misaligned by simple handcrafted inputs. In particular, we investigate two types of attacks -- goal hijacking and prompt leaking -- and demonstrate that even low-aptitude, but sufficiently ill-intentioned agents, can easily exploit GPT-3's stochastic nature, creating long-tail risks. The code for PromptInject is available at https://github.com/agencyenterprise/PromptInject.

研究の動機と目的

  • LLM の本番環境に近い設定で対向的プロンプト攻撃の研究を動機づけ、形式化する。
  • このような攻撃を構成・評価するモジュール式フレームワークとして PromptInject を提案する。
  • 実行可能な攻撃ベクトル(ゴール奪取とプロンプト漏洩)を特徴づけ、それらの成功に影響を与える要因を識別する。
  • プロンプル設計とモデル設定にわたる経験的結果を提供し、より安全なプロンプト設計実践を促す。

提案手法

  • ベースプロンプト、攻撃プロンプト、プライベート値、デリミタを含むモジュール式プロンプト組み合わせフレームワーク(PromptInject)を定義する。
  • text-davinci-002 を用いて、35 のベースプロンプトと複数のハイパーパラメータでゴール奪取とプロンプト漏洩を実験的に評価する。
  • 攻撃の成功を、ゴール奪取の厳密一致とプロンプト漏洩の元のプロンプトの包含、さらにはファジィマッチの考慮で測定する。
  • デリミタ、 rogue 字列、温度、ストップ系列、user_input 後のテキストなど、モデル設定全体で攻撃有効性に影響を与える要因を分析する。
  • リスク分析(x リスク)を報告し、内容モデレーションやデュアルパラメータ安全設計などの潜在的な緩和手段を議論する。

実験結果

リサーチクエスチョン

  • RQ1ゴール奪取やプロンプト漏洩といった敵対的なプロンプト注入が LLM にどの程度影響を及ぼすか?
  • RQ2そのような攻撃の成功率を高めたり低下させたりするプロンプト設計やモデル設定は何か?
  • RQ3本番品質のプロンプトや設定は、簡易なハンドメイドの敵対的入力にどの程度耐えられるか?
  • RQ4 deployed LLM アプリケーションでこれらのプロンプト注入リスクを低減する実践的な緩和策は何か?

主な発見

  • ゴール奪取は特定のプロンプトと設定下で約 58.6%±1.6% の成功を達成し、強力な LLM が悪意ある入力に対して高い感受性を示すことを実証した。
  • プロンプト漏洩は最適化された調整下で約 23.6%±2.7% の成功を達成し、漏洩は奪取より難しいが依然として実行可能であることを示した。
  • 指示を明確に分離するデリミタは攻撃成功を大幅に高め、デリミタの長さや繰り返しが影響を最大化することがある。
  • 温度が高いほど攻撃成功はやや低下する一方でモデルの予測性は不安定になり、Top-P やペナルティの効果は混在または限定的である。
  • Text-davinci-002 は、他の小型モデルや OpenAI のモデルよりも攻撃に対して顕著に脆弱であった。
  • 緩和手段としては、ストップ系列、出力長の制限、事後モデレーション、デュアルパラメータ安全制御などの設計が挙げられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。