[論文レビュー] PAL: Proxy-Guided Black-Box Attack on Large Language Models
本稿では、実世界のLLM APIに対する最適化ベースのブラックボックス脱獄攻撃であるPAL(Proxy-Guided Attack on Large Language Models)を紹介する。これは、サーヴィスモデルとしてのオープンソース代替モデルを用いて勾配ベースのトークンレベル最適化をガイドし、実際のAPI動作に特化した新しい損失関数を採用することで、GPT-3.5-Turboで84%、Llama-2-7Bで48%の攻撃成功率を達成した。これは、先行する最先端手法を著しく上回るものである。
Large Language Models (LLMs) have surged in popularity in recent months, but they have demonstrated concerning capabilities to generate harmful content when manipulated. While techniques like safety fine-tuning aim to minimize harmful use, recent works have shown that LLMs remain vulnerable to attacks that elicit toxic responses. In this work, we introduce the Proxy-Guided Attack on LLMs (PAL), the first optimization-based attack on LLMs in a black-box query-only setting. In particular, it relies on a surrogate model to guide the optimization and a sophisticated loss designed for real-world LLM APIs. Our attack achieves 84% attack success rate (ASR) on GPT-3.5-Turbo and 48% on Llama-2-7B, compared to 4% for the current state of the art. We also propose GCG++, an improvement to the GCG attack that reaches 94% ASR on white-box Llama-2-7B, and the Random-Search Attack on LLMs (RAL), a strong but simple baseline for query-based attacks. We believe the techniques proposed in this work will enable more comprehensive safety testing of LLMs and, in the long term, the development of better security guardrails. The code can be found at https://github.com/chawins/pal.
研究の動機と目的
- 特許権のあるLLMがブラックボックスAPIでのみ公開されている状況において、実用的で効率的な安全性評価のニーズに対応すること。
- ランダムサーチや遺伝的アルゴリズムに依存する従来のクエリベース攻撃の限界(非効率で効果が低い)を克服すること。
- スケーラブルで低コストな方法を提供し、安全対策が施されたLLMの脱獄を可能とすることで、包括的なレッドチーム作業とセキュリティガードレールの向上を実現すること。
- GCG白ボックス攻撃を改善し、GCG++を導入することで、Llama-2-7Bのような頑健なモデルに対しても高い成功率を達成すること。
- RAL(LLMに対するランダムサーチ攻撃)を提案することで、クエリベース攻撃の強力なベースラインを確立し、最小限のコストで驚くべき効果を示すこと。
提案手法
- 公開済みのオープンソースプロキシモデル(例:Llama-2)を活用し、敵対的プロンプトの最適化をガイドする勾配を生成する。
- 勾配ベースのトークンレベル最適化を適用し、安全対策メカニズムを回避するプロンプト接尾辞を反復的に最適化する。
- 実世界のLLM APIに特化した新しい損失関数を採用し、微分不可能な出力やモデルの拒否行動を考慮する。
- クエリ効率の高い戦略を採用:プロキシモデルが探索をガイドすることで、ターゲットLLM APIへの高コストな呼び出し回数を最小限に抑える。
- Greedy Coordinate Gradient(GCG)攻撃の拡張版として、改善された最適化ヒューリスティクスと損失設計を組み込んだGCG++を導入する。
- 勾配ガイドをランダムサーチに置き換えた単純だが効果的なベースラインとして、RAL(LLMに対するランダムサーチ攻撃)を提案する。

実験結果
リサーチクエスチョン
- RQ1勾配がターゲットLLMから入手できない実世界のブラックボックス環境において、プロキシガイド付きの最適化ベース攻撃が高成功率を達成できるか?
- RQ2ターゲットモデルの勾配に直接アクセスできない状況でも、代替モデルが敵対的プロンプトの探索をどれほど効果的にガイドできるか?
- RQ3非決定的出力や拒否メッセージを返す可能性のある実際のLLM APIとやり取りする際、どの損失関数設計が攻撃成功率を最大にするか?
- RQ4提案手法が、特許権のあるLLMおよびオープンウェイトLLMの両方において、従来のクエリベース攻撃を成功率とコスト効率の面で著しく上回れるか?
- RQ5ブラックボックスLLM脱獄において、単純なランダムサーチがより複雑な最適化手法をどれほど模倣または上回れるか?
主な発見
- PALはGPT-3.5-Turbo-1106で84%の攻撃成功率を達成し、先行する最先端手法(58%)を28%上回り、コストは半分に抑えられた。
- Llama-2-7Bでは48%の攻撃成功率を達成したが、これは先行する最先端手法(4%)を著しく上回るものである。
- GPT-3.5-Turboでの成功脱獄を達成する平均コストはわずか$0.88であり、非常に高いコスト効率を示している。
- RAL(ランダムサーチ版)は25,000クエリ以内でLlama-2-7Bで26%の攻撃成功率を達成し、今後の研究の強力なベースラインを確立した。
- GCG++は元のGCG白ボックス攻撃の成功率をLlama-2-7Bで56%から80%に向上させ、洗練された最適化技術の価値を示した。
- 本研究では、ターゲットモデルへのアクセスが限定的であっても、プロキシガイド付き最適化が現代のLLMにおける安全対策メカニズムを効果的に回避できることを示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。