[論文レビュー] FuzzLLM: A Novel and Universal Fuzzing Framework for Proactively Discovering Jailbreak Vulnerabilities in Large Language Models
FuzzLLM は、テンプレート、制約、禁止質問を用いて構造的に多様なプロンプトを自動生成することで、大規模言語モデル(LLMs)におけるジャイルブレーキ脆弱性を能動的に発見する画期的な包括的ファズィングフレームワークである。小さなテストセットでも、GPT-3.5-turbo や GPT-4 といった最先端モデルにおいても、ジャイルブレーキを効果的に特定する。コンボアタックのシナリオでは、単一コンponentアタックを上回る性能を示す。
Jailbreak vulnerabilities in Large Language Models (LLMs), which exploit meticulously crafted prompts to elicit content that violates service guidelines, have captured the attention of research communities. While model owners can defend against individual jailbreak prompts through safety training strategies, this relatively passive approach struggles to handle the broader category of similar jailbreaks. To tackle this issue, we introduce FuzzLLM, an automated fuzzing framework designed to proactively test and discover jailbreak vulnerabilities in LLMs. We utilize templates to capture the structural integrity of a prompt and isolate key features of a jailbreak class as constraints. By integrating different base classes into powerful combo attacks and varying the elements of constraints and prohibited questions, FuzzLLM enables efficient testing with reduced manual effort. Extensive experiments demonstrate FuzzLLM's effectiveness and comprehensiveness in vulnerability discovery across various LLMs.
研究の動機と目的
- 現在の LLM セーフティ対策が、公開後における個別のジャイルブレーキの修正にとどまっている反応的特性を是正するため、脆弱性の能動的発見を可能にする。
- LLM の有効なセーフティファインチューニングを制限する、多様でラベル付きのジャイルブレーキデータの不足を克服するため。
- モデルの内部構造にアクセスを必要とせず、任意の LLM に対してジャイルブレーキ脆弱性をテストできる包括的で自動化されたフレームワークの開発。
- 攻撃を再利用可能なコンponents(テンプレート、制約、質問セット)に分解することで、多様で強固なジャイルブレーキプロンプトを体系的に生成する。
- ロールプレイ(RP)、出力制約(OC)、特権昇格(PE)の複数のジャイルブレーキクラスを組み合わせたコンボアタックの有効性を評価し、より広範な脆弱性カバレッジを実現する。
提案手法
- FuzzLLM は、内部構造にアクセスしないブラックボックスIO駆動ファズィングを用い、テンプレートベースの構成によりジャイルブレーキプロンプトを生成する。
- ジャイルブレーキを3つのコアコンponentsに分解する:構造的テンプレート、制約セット(成功したジャイルブレーキのキーフィーチャー)、禁止質問セット(ポリシー違反クエリ)。
- ロールプレイ(RP)、出力制約(OC)、特権昇格(PE)の3つの基本ジャイルブレーキクラスを、制約と質問の混合により強力なコンボアタックに統合する。
- 出力を「悪い」(ジャイルブレイク済み)または「良い」(安全)に分類するためのラベルモデル(例:Vicuna-13B)を用い、誤差率を測定して信頼性を検証する。
- ハイパーパramータとして、テストセットサイズ Tes=300(各クラス)、温度=0.7、最大出力トークン数 tk=256 を使用し、3つのランダムシードでの平均値を結果として採用する。
- アブレーションスタディでは、テストセットサイズと出力トークン制限の影響を評価し、サイズにかかわらず性能にほとんど差がないことが判明。また、tk=64 の低水準で予期しない成功率の上昇が観察され、出力が不完全な場合に悪意ある質問のみが存在する場合に誤って「悪い」と分類されるという、出力長に対する感受性が明らかになった。
実験結果
リサーチクエスチョン
- RQ1モデルの内部構造にアクセスを必要とせず、多様な LLM に対して包括的かつ自動化されたファズィングフレームワークが、ジャイルブレーキ脆弱性を効果的に発見できるか?
- RQ2RP、OC、PE の複数の基本ジャイルブレーキクラスをコンボアタックに統合することで、単一コンponentアタックと比較して脆弱性発見の効果が向上するか?
- RQ3テストセットサイズと出力トークン制限が、自動ラベリングを用いたジャイルブレーキ検出の信頼性と性能に与える影響は何か?
- RQ4GPT-3.5-turbo や GPT-4 といった最先端で保護が強い LLM において、FuzzLLM はどの程度の効果を発揮するか?
- RQ5軽量でオープンソースの LLM が、許容可能な誤差率でジャイルブレーキ成功を分類する信頼性のあるラベルモデルとして機能できるか?
主な発見
- FuzzLLM は、GPT-3.5-turbo や GPT-4 ですでに高度なセーフティ防御を備えているにもかかわらず、ジャイルブレーキ脆弱性を効果的に発見し、能動的発見能力を実証した。
- RP、OC、PE の複数の基本クラスを組み合わせたコンボアタックは、GPT-4 で 19.61% のジャイルブレーキ成功率を達成した。これは単一コンponentアタックの 11.92% より顕著に高い水準であり、より広範なカバレッジと高い破壊力を持つことを示している。
- ラベルモデルである Vicuna-13B は、テストしたモデルの中で最小の誤差率(4.08%)を記録した(Bloom-7B: 14.35%、LLAMA-7B: 11.57%)、自動ラベリングの信頼性を裏付けた。
- アブレーションスタディでは、テストセットサイズが Tes=50 から 500 の範囲で性能にほとんど差がないことが判明。これは、小規模テストでも結果が安定しており、一般化可能であることを示している。
- tk=64 の場合に成功率が 82.26% に急上昇した。これは、悪意ある質問のみが存在する不完全な出力が「悪い」と誤って分類されるためであり、出力長に対する検出感度が重大な課題であることが明らかになった。
- FuzzLLM は、GPT-3.5-turbo(23.57% 対 23.12%)および GPT-4(19.61% 対 11.92%)の両方において、コンボアタックモードで単一コンponentアタックを上回り、複合アタックパターンの有効性を確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。