[論文レビュー] Tensor Trust: Interpretable Prompt Injection Attacks from an Online Game
この論文では、126,000件を超える人間が作成したプロンプトインジェクション攻撃と、46,000件の防御策を生成するオンラインゲーム「Tensor Trust」を紹介する。GPT-3.5 Turboをバックエンドに使用することで、解釈可能な攻撃パターンを明らかにし、LLMのプロンプト乗っ取りおよび抽出に対する耐性をベンチマークした。その結果、多くのモデルがゲーム設定から一般化された戦略に対しても依然として脆弱であることが示された。
While Large Language Models (LLMs) are increasingly being used in real-world applications, they remain vulnerable to prompt injection attacks: malicious third party prompts that subvert the intent of the system designer. To help researchers study this problem, we present a dataset of over 126,000 prompt injection attacks and 46,000 prompt-based "defenses" against prompt injection, all created by players of an online game called Tensor Trust. To the best of our knowledge, this is currently the largest dataset of human-generated adversarial examples for instruction-following LLMs. The attacks in our dataset have a lot of easily interpretable stucture, and shed light on the weaknesses of LLMs. We also use the dataset to create a benchmark for resistance to two types of prompt injection, which we refer to as prompt extraction and prompt hijacking. Our benchmark results show that many models are vulnerable to the attack strategies in the Tensor Trust dataset. Furthermore, we show that some attack strategies from the dataset generalize to deployed LLM-based applications, even though they have a very different set of constraints to the game. We release all data and source code at https://tensortrust.ai/paper
研究の動機と目的
- 人間が生成した悪意ある例を通じて、指示微調整済みLLMにおける現実世界のプロンプトインジェクション脆弱性を調査すること。
- 実際の人間の戦略を反映した、スケーラブルで解釈可能な攻撃および防御のデータセットを構築すること。
- プロンプト抽出とプロンプト乗っ取りの2つの主要な攻撃タイプに対するLLMの耐性を評価すること。
- ゲームから得られた攻撃戦略が、現実世界のLLMアプリケーションに一般化可能であることを示すこと。
- 今後のLLMセキュリティ研究のための再現可能でオープンソースのベンチマークとデータセットを提供すること。
提案手法
- Tensor Trustウェブゲームは、プレイヤーが秘密のコードを入力した場合にのみ「アクセス許可」が発動する安全なアクセスシステムをシミュレートする。
- 攻撃者は、コードや防御の内容を知らないまま、LLMが「アクセス許可」を出力するようなプロンプトを設計しなければならない。これは、現実世界のプロンプトインジェクションを模倣する。
- すべての攻撃と防御はライブプレイから収集され、プレイヤーIDとタイムスタンプを含む、126,808件の攻撃と46,457件の防御からなるデータセットが得られた。
- 著者らは2つのベンチマークを設計した:1つは防御プロンプトの再構築(プロンプト抽出)を目的とし、もう1つはコードなしでアクセスを取得すること(プロンプト乗っ取り)を目的としている。
- 実験では、GPT-3.5 Turboの耐性を5つのメッセージロールスキームで評価し、性能に顕著な差は認められなかった。
- データセットから得られた攻撃戦略を現実世界のLLMベースのアプリケーションに適用した結果、異なる制約下でも設定間での一般化が確認された。

実験結果
リサーチクエスチョン
- RQ1現実世界のゲーム環境で、人間が生成した解釈可能なプロンプトインジェクション戦略はどのようなものであるか?
- RQ2多様で人間が設計した攻撃にさらされた場合、指示微調整済みLLMはどの程度のプロンプトインジェクションに対して耐性を示すか?
- RQ3ゲームから得られた攻撃戦略は、異なる制約を受ける現実世界のLLMアプリケーションにどの程度一般化可能か?
- RQ4ロールの割り当て(システム/ユーザー)は、LLMのプロンプトインジェクションに対する感受性にどのように影響するか?
- RQ5ゲームベースのデータ収集アプローチは、大規模で高品質なLLMセキュリティ評価のベンチマークを生成可能か?
主な発見
- Tensor Trustデータセットには、126,808件の固有のプロンプトインジェクション攻撃と46,457件の防御が含まれており、これは、指示従属LLM向けに知られている最大の人間生成データセットである。
- GPT-3.5 Turboは、全メッセージロールスキームにおいて19%~31%のプロンプト乗っ取り耐性率(HRR)を示し、一貫した脆弱性を示した。
- プロンプト抽出耐性率(ERR)は27%~35%の間で変動し、多くのモデルが内部のプロンプト論理を保護できないことが示された。
- ゲームの結果、LLMはしばしば「ユーザー」の指示を「システム」の指示よりも優先するため、深刻な設計上の欠陥が露呈した。
- ゲームから得られた複数の攻撃戦略が、異なる制約下でも現実世界のLLMベースのアプリケーションを効果的に回避した。
- このデータセットにより、希少トークンでの奇妙な挙動やロールの混乱といった、LLMの失敗モードの解釈可能な分析が可能になった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。