[論文レビュー] AutoDAN: Interpretable Gradient-Based Adversarial Attacks on Large Language Models
AutoDANは、左から右へ逐次トークンを最適化することで、人間が読みやすい高成功率の jailbreak プロンプトを生成する、解釈可能で勾配ベースの新たな敵対的攻撃を導入する。従来の方法が無意味な文字列を生成するか手作業による設計に依存するのに対し、AutoDANは、限られた訓練データでもブラックボックスモデルに対して高い読みやすさと高い一般化性能を達成し、自動的なシステムプロンプト漏洩を可能にする。
Safety alignment of Large Language Models (LLMs) can be compromised with manual jailbreak attacks and (automatic) adversarial attacks. Recent studies suggest that defending against these attacks is possible: adversarial attacks generate unlimited but unreadable gibberish prompts, detectable by perplexity-based filters; manual jailbreak attacks craft readable prompts, but their limited number due to the necessity of human creativity allows for easy blocking. In this paper, we show that these solutions may be too optimistic. We introduce AutoDAN, an interpretable, gradient-based adversarial attack that merges the strengths of both attack types. Guided by the dual goals of jailbreak and readability, AutoDAN optimizes and generates tokens one by one from left to right, resulting in readable prompts that bypass perplexity filters while maintaining high attack success rates. Notably, these prompts, generated from scratch using gradients, are interpretable and diverse, with emerging strategies commonly seen in manual jailbreak attacks. They also generalize to unforeseen harmful behaviors and transfer to black-box LLMs better than their unreadable counterparts when using limited training data or a single proxy model. Furthermore, we show the versatility of AutoDAN by automatically leaking system prompts using a customized objective. Our work offers a new way to red-team LLMs and understand jailbreak mechanisms via interpretability.
研究の動機と目的
- 既存の敵対的攻撃が読みにくい、パーセプルキティフィルタ検出可能なプロンプトを生成するという限界を是正すること。
- 手作業による jailbreak(読みやすいが希少)と自動攻撃(読みにくいがスケーラブル)の間のギャップを埋めること。
- 事前にタスク固有の知識を必要とせず、解釈可能で一般化可能で効果的な jailbreak プロンプトを生成する勾配ベースの手法を開発すること。
- カスタマイズされた最適化目的を用いて、自動的にシステムプロンプト漏洩を可能にすること。
- 人間が設計した jailbreak に類似した多様で解釈可能な攻撃戦略を生成することで、レッドチームの能力を強化すること。
提案手法
- AutoDANは、自己回帰的言語生成を模倣するために、左から右へ逐次トークンを生成する攻撃プロンプトを生成する。
- 1トークンあたり2段階の最適化プロセスを採用:まず妥当な候補を探索する予備ステップを実施し、その後、jailbreak 効果と読みやすさのバランスを最適化するフィンガーリングステップを実施する。
- jailbreak 成功度とパーセプルキティ(読みやすさ)の重み付き組み合わせが、変動するトークンエントロピーに適応しながら勾配ベースの最適化を導く。
- 単一のホワイトボックスプロキシモデルを用いて、GPT-3.5 や GPT-4 などのブラックボックス LLM に対しても一般化が図れるプロンプトを生成する。
- システムプロンプト漏洩のため、直接隠しシステム指示を抽出することを最適化対象とするカスタマイズされた目的関数を適用する。
- アプローチは完全に自動的であり、事前に既知の jailbreak テンプレートや人間が設計した戦略を必要としない。
実験結果
リサーチクエスチョン
- RQ1勾配ベースの最適化は、パーセプルキティフィルタを回避できる解釈可能な読みやすい敵対的プロンプトを生成できるか?
- RQ2自動攻撃手法は、読みやすさと高い攻撃成功率の両方を達成でき、手作業と自動攻撃の長所を統合できるか?
- RQ3AutoDAN が生成するプロンプトは、従来の敵対的攻撃と比較して、ブラックボックス LLM へどれほど一般化できるか?
- RQ4AutoDAN は、隠しシステム指示を自動で抽出するプロンプトを生成できるか?
- RQ5生成されたプロンプトは、手作業による jailbreak でよく見られる多様で解釈可能な戦略(例:ロールプレイ、指示操作)を示すか?
主な発見
- AutoDAN が生成するプロンプトは、Vicuna 7B において90%を超える高い攻撃成功率を達成しながらも、低いパーセプルキティを維持し、成功度-パーセプルキティのトレードオフ空間の左上に集約される。
- 特に低正則化重み下で、パーセプルキティ正則化を施した GCG-reg よりも、読みやすさと攻撃成功率の両面で優れている。
- GCG が生成する読みにくいプロンプトとは異なり、単一のプロキシモデルでの学習のみで、GPT-3.5 や GPT-4 といったブラックボックスモデルへも、AutoDAN のプロンプトはより優れた一般化性能を示す。
- AutoDAN が生成するプロンプトは、ロールプレイや指示操作といった、手作業による jailbreak でよく見られる多様で解釈可能な戦略を示している。
- カスタマイズされた目的関数を用いて、AutoDAN はシステムプロンプトの漏洩に成功し、標準的な jailbreak タスクを超えた汎用性を示している。
- 手作業で作成したプレフィックス/サフィックスを組み込む Semi-AutoDAN は、攻撃効果を損なわず、プロンプトの品質とスタイル制御をさらに向上させている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。