[論文レビュー] A Wolf in Sheep's Clothing: Generalized Nested Jailbreak Prompts can Fool Large Language Models Easily
本稿では、プロンプトの再書き換えとシナリオネスティングを用いて、LLMのセーフティ対策を回避するための自動フレームワークReNeLLMを提案する。LLMを活用して意味を保ちつつも検出されにくいプロンプトを、一般的なタスクに埋め込むことで、ベースラインと比較して40%以上の高い攻撃成功率を達成するとともに、時間コストも削減し、現在の防御メカニズムにおける深刻な脆弱性を暴露する。
Large Language Models (LLMs), such as ChatGPT and GPT-4, are designed to provide useful and safe responses. However, adversarial prompts known as 'jailbreaks' can circumvent safeguards, leading LLMs to generate potentially harmful content. Exploring jailbreak prompts can help to better reveal the weaknesses of LLMs and further steer us to secure them. Unfortunately, existing jailbreak methods either suffer from intricate manual design or require optimization on other white-box models, which compromises either generalization or efficiency. In this paper, we generalize jailbreak prompt attacks into two aspects: (1) Prompt Rewriting and (2) Scenario Nesting. Based on this, we propose ReNeLLM, an automatic framework that leverages LLMs themselves to generate effective jailbreak prompts. Extensive experiments demonstrate that ReNeLLM significantly improves the attack success rate while greatly reducing the time cost compared to existing baselines. Our study also reveals the inadequacy of current defense methods in safeguarding LLMs. Finally, we analyze the failure of LLMs defense from the perspective of prompt execution priority, and propose corresponding defense strategies. We hope that our research can catalyze both the academic community and LLMs developers towards the provision of safer and more regulated LLMs. The code is available at https://github.com/NJUNLP/ReNeLLM.
研究の動機と目的
- 手作業や最適化ベースの jailbreak 方法には、時間のかかること、脆弱であること、意味的に不自然であることといった限界があるため、それらを解消すること。
- プロンプトの再書き換えとシナリオネスティングの2つのコアパターンを特定することで、jailbreak 攻撃を一般化すること。
- 微調整や最適化を一切行わず、LLM自身を用いて高成功率の jailbreak プロンプトを自動生成する、効率的で効果的なフレームワークの開発。
- これらの一般化された攻撃に対して、現在の防御メカニズムの頑健性を評価すること。
- プロンプト実行中の注意メカニズムの分析を通じて、LLMが悪意あるコンテンツをなぜ検出できないのかを解明すること。
提案手法
- ReNeLLM は jailbreak 攻撃を2つの要素に一般化する:プロンプトの再書き換えとシナリオネスティング。
- プロンプトの再書き換えは、語義を保持しつつ検出を回避するための言語的変換(例:同義語置換、構文の再表現、スペルミス)を適用する。
- シナリオネスティングは、表計算の入力、テキストの補完、コード生成などの一般的なタスクの文脈に再書き換え済みプロンプトを埋め込むことで、悪意ある意図を隠蔽する。
- フレームワークは LLM を用いて、再書き換えおよびネスティング戦略の最適な組み合わせを自動で探索・選択する。
- 追加の訓練や勾配ベースの最適化を一切行わず、LLM の推論および生成能力に依存する。
- 注意可視化を用いて、実行中に LLM が外部の指示と内部の悪意ある指示のどちらを優先しているかを分析し、検出を回避するための注意のシフトを特定する。

実験結果
リサーチクエスチョン
- RQ1プロンプトの再書き換えとシナリオネスティングの一般化されたパターンは、多様な LLM において、jailbreak の成功率を顕著に向上させることができるか?
- RQ2意味を保ちつつ再書き換えするプロセスと文脈に埋め込むネスティングの組み合わせが、LLM の注意メカニズムと応答行動にどのように影響を与えるか?
- RQ3意味的に整合性があるにもかかわらず、なぜ現在の防御メカニズムは ReNeLLM が生成する jailbreak プロンプトをブロックできないのか?
- RQ4ReNeLLM は、攻撃成功率と効率性の面で、既存のベースラインをどの程度上回るのか?
- RQ5ネストされた jailbreak プロンプトを実行する際、LLM の注意メカニズムはどのように変化するのか?そして、これにはモデルの安全性にどのような含みがあるか?
主な発見
- Llama-2-chat-70b において、ReNeLLM はベースライン手法と比較して40%以上の高い攻撃成功率を達成し、顕著な性能向上を示した。
- GPT-3.5 において、プロンプトの再書き換えとシナリオネスティングを組み合わせると、攻撃成功率が40%以上上昇し、両者のコンポonent間の強い相乗効果が確認された。
- 注意可視化の結果、ネスティング後、LLM が外部タスクの指示を内部の悪意あるプロンプトよりも優先して処理していることが明らかになった。これにより、検出の可能性が低下した。
- パープレキシティや意味的フィルタリングに基づく防御は、再書き換え済みプロンプトが高い流暢さと一貫性を保っているため、ReNeLLM に対しては失敗した。
- GCG などの最適化ベースの手法とは異なり、反復的探索や勾配計算を要しないため、ReNeLLM は時間コストを顕著に削減した。
- 安全対策のための微調整が施された LLM でさえも、ReNeLLM の一般化された攻撃パターンに対して脆弱であることが判明し、現在のアライメント技術における根本的な欠陥が露呈された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。