[論文レビュー] Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM
本稿では、モンテカルロサンプリングとランダムトークンドロップを用いてテスト入力の耐性を評価することで、既存のアラインドLLMに対するアラインメント破壊攻撃を強化する防御機構であるRobustly Aligned LLM (RA-LLM)を提案する。再訓練を必要とせず、攻撃成功率をほぼ100%から10%未満に低下させ、モデルの内在的アラインメントを活用しながら、敵対的プロンプトに対する耐性を向上させる。
Recently, Large Language Models (LLMs) have made significant advancements and are now widely used across various domains. Unfortunately, there has been a rising concern that LLMs can be misused to generate harmful or malicious content. Though a line of research has focused on aligning LLMs with human values and preventing them from producing inappropriate content, such alignments are usually vulnerable and can be bypassed by alignment-breaking attacks via adversarially optimized or handcrafted jailbreaking prompts. In this work, we introduce a Robustly Aligned LLM (RA-LLM) to defend against potential alignment-breaking attacks. RA-LLM can be directly constructed upon an existing aligned LLM with a robust alignment checking function, without requiring any expensive retraining or fine-tuning process of the original LLM. Furthermore, we also provide a theoretical analysis for RA-LLM to verify its effectiveness in defending against alignment-breaking attacks. Through real-world experiments on open-source large language models, we demonstrate that RA-LLM can successfully defend against both state-of-the-art adversarial prompts and popular handcrafted jailbreaking prompts by reducing their attack success rates from nearly 100% to around 10% or less.
研究の動機と目的
- 敵対的または手作業で作成された脱獄プロンプトによるアラインメント破壊攻撃に対して脆弱である既存のアラインドLLMの問題を解決すること。
- 再訓練やファインチューニングを必要とせず、既存のアラインドLLMの耐性を向上させる防御機構を設計すること。
- 有害なコンテンツにとどまらず、有害性、倫理的配慮、プライバシー関連など多様なアラインメントタイプに有効であることを保証すること。
- 実世界での展開に適した理論的根拠と計算可能性を備えた方法を提供すること。
提案手法
- RA-LLMは、入力プロンプトに対してモンテカルロサンプリングを適用し、各サンプルでランダムに一部のトークンを削除する。
- 複数のサンプル入力に対してモデルの応答を評価し、有害な要求に対して一貫して拒否するかを確認する。
- 要求が多数のサンプル入力で拒否された場合にのみ、良性と分類される。これにより、微小な摂動に対して耐性が確保される。
- 閾値ベースの意思決定ルールを用いる:n回の試行のうち少なくともt回でモデルが要求を拒否すれば、安全とみなされる。
- 外部の有害コンテンツ検出器を必要とせず、モデルの内部アラインメント能力にのみ依存する。
- ドロップアウト率(p)、モンテカルロ試行回数(n)、拒否閾値(t)といったハイパーパrameterは、性能と計算コストのバランスをとるために調整される。
実験結果
リサーチクエスチョン
- RQ1再訓練やファインチューニングを必要とせず、既存のアラインドLLMをアラインメント破壊攻撃に対して耐性を持つようにする防御機構を設計可能か?
- RQ2ランダムトークンドロップは、敵対的および手作業で作成された脱獄プロンプトに対するモデルの耐性をどの程度向上させるか?
- RQ3提案手法は、悪意のある要求の処理を維持しつつ、攻撃成功率をどの程度低減できるか?
- RQ4防御機構の計算コストはどの程度で、実用的展開に最適化可能か?
- RQ5ランダムドロップ処理の非微分性により、勾配ベースの攻撃手法に対しても防御は耐性があるか?
主な発見
- RA-LLMによる防御により、最先端の敵対的プロンプトの攻撃成功率はほぼ100%から10%未満に低下した。
- 手作業で作成された脱獄プロンプトに対しても、同様に顕著な成功率低下が確認され、攻撃タイプを問わず耐性が確認された。
- 10回のモンテカルロ試行すらあれば、RA-LLMは良性応答率を95%以上に維持し、攻撃成功率を15%未満に抑えることができた。
- 計算コストはGPT-4で約1.25倍、GPT-3.5 Turboで約1.5倍に上昇したが、防御の恩恵を考えれば妥当な水準とされた。
- 非微分性を持つランダムドロップ処理のおかげで、勾配ベースの攻撃に対して防御が有効であることが確認され、最適化に基づく攻撃生成の効果が制限された。
- アブレーションスタディにより、p、t、nといったハイパーパrameterの調整が、性能と計算コストのトレードオフを実現可能であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。