[論文レビュー] Ignore This Title and HackAPrompt: Exposing Systemic Vulnerabilities of LLMs through a Global Scale Prompt Hacking Competition
本論文は、人間が生成した悪意あるプロンプトを通じて大規模な大規模言語モデル(LLM)のシステム的脆弱性を体系的に露呈するため、グローバル規模のプロンプトハッキングコンテスト「HackAPrompt」を導入した。3つの最先端LLMを標的とした60万件を超えるプロンプトを収集することで、プロンプトハッキングの実現可能性を実証的に検証し、攻撃パターンの包括的な分類的オントロジーを確立した。その結果、実世界のLLM導入における深刻なセキュリティリスクが明らかになった。
Large Language Models (LLMs) are deployed in interactive contexts with direct user engagement, such as chatbots and writing assistants. These deployments are vulnerable to prompt injection and jailbreaking (collectively, prompt hacking), in which models are manipulated to ignore their original instructions and follow potentially malicious ones. Although widely acknowledged as a significant security threat, there is a dearth of large-scale resources and quantitative studies on prompt hacking. To address this lacuna, we launch a global prompt hacking competition, which allows for free-form human input attacks. We elicit 600K+ adversarial prompts against three state-of-the-art LLMs. We describe the dataset, which empirically verifies that current LLMs can indeed be manipulated via prompt hacking. We also present a comprehensive taxonomical ontology of the types of adversarial prompts.
研究の動機と目的
- LLMにおけるプロンプトハッキングに関する大規模かつ定量的な研究の不足に対処すること。
- 生産環境に類似したLLMデプロイメントに対して、自由形式のユーザー入力による攻撃を可能にすることで、実世界の攻撃シナリオをシミュレートすること。
- 攻撃の種類と成功率を理解するために、悪意あるプロンプトの大量データセットを収集・分析すること。
- モデルの耐性強化と防御戦略の向上を目的として、プロンプトハッキング技術の体系的分類的オントロジーを構築すること。
- 今後のLLMセキュリティおよびアライメント分野の研究を支援するため、HuggingFaceに公開可能なデータセットを提供すること。
提案手法
- 2,800人以上の参加者から悪意あるプロンプトを引き出すために、報奨金を付与したグローバルなプロンプトハッキングコンテストを主催した。
- GPT-3.5-turboを含む3つの最先端LLMを標的とした、60万件を超える悪意あるプロンプトを収集した。
- 複数のレベルを備えた構造化されたコンテストを設計し、特にトークン制限の操作を要する「マッドサンドイッチ防御」レベルを含んだ。
- 文字置換、中国語への翻訳、トークン数のカウントといった技術を用いて、制約を回避するためのプロンプト生成と最適化を自動化した。
- 攻撃の意図を保持しつつ、トークン制限に合わせて動的にユーザー入力を埋め込むための、擬似コードベースの自動化パイプライン(アルゴリズム1)を開発した。
- 観察された攻撃パターンと戦略に基づき、悪意あるプロンプトの種類に関する包括的な分類的オントロジーを構築した。

実験結果
リサーチクエスチョン
- RQ1最先端LLMを操作するために、どの種類の悪意あるプロンプトが最も効果的であるか?
- RQ2実世界の対話型LLMデプロイメントにおいて、プロンプトインジェクション攻撃はどれほど広範かつスケーラブルに発生するのか?
- RQ3人間が生成したプロンプトハッキングの試みから、どのような体系的パターンと戦略が浮き彫りになるか?
- RQ4自動化は、効果的なプロンプト攻撃の発見と洗練をどの程度向上できるか?
- RQ5大規模かつ人間が手作業で選別した悪意あるプロンプトデータセットは、LLMセキュリティの評価と防御をどのように改善できるか?
主な発見
- 2,800人以上の参加者から60万件を超える悪意あるプロンプトが成功裏に収集され、プロンプトハッキングの広範な実現可能性が裏付けられた。
- 本研究は、複雑なプロンプトテンプレートで保護されている場合でさえも、現在のLLMがプロンプトインジェクション攻撃に対して極めて感受性が高いことを実証的に確認した。
- 「プロンプトに従う」、コードインジェクション、括弧/引用符の操作、ダミー入力といった多様な攻撃戦略が同定された。
- 自動化は攻撃の効率を顕著に向上させた。特に、動的な入力埋め込みと文字置換により、トークン制限のあるレベル9で成功率が向上した。
- プロンプトの一部を中国語に翻訳することで、特定のLLMの誤解を回避できた。これは、モデルの挙動が入力のエンコーディングや言語的文脈に敏感である可能性を示唆している。
- 得られたデータセットは、特定のモデルの出力に正確に対応するユーザー入力の収集において、これまでに知られている最大規模のものであり、より安全なLLMの訓練と評価のための新たな機会を提供している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。