Skip to main content
QUICK REVIEW

[論文レビュー] Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization

Zhexin Zhang, Junxiao Yang|arXiv (Cornell University)|Nov 15, 2023
Text Readability and Simplification被引用数 6
ひとこと要約

この論文は、推論段階および学習段階の両方で、安全性を助けの優先順位よりも高く設定することで、大規模言語モデル(LLMs)に対する脱法攻撃に対する防御を提案する。推論段階での適用により、ChatGPTの攻撃成功率(ASR)は66.4%から2.0%に低下し、Vicuna-33Bでは68.2%から19.4%に低下する。学習段階で目的優先を適用した場合、Llama2-13BのASRはわずか6.6%にまで低下するが、学習に脱法プロンプトを含めない状況でも成立する。

ABSTRACT

While significant attention has been dedicated to exploiting weaknesses in LLMs through jailbreaking attacks, there remains a paucity of effort in defending against these attacks. We point out a pivotal factor contributing to the success of jailbreaks: the intrinsic conflict between the goals of being helpful and ensuring safety. Accordingly, we propose to integrate goal prioritization at both training and inference stages to counteract. Implementing goal prioritization during inference substantially diminishes the Attack Success Rate (ASR) of jailbreaking from 66.4% to 3.6% for ChatGPT. And integrating goal prioritization into model training reduces the ASR from 71.0% to 6.6% for Llama2-13B. Remarkably, even in scenarios where no jailbreaking samples are included during training, our approach slashes the ASR by half. Additionally, our findings reveal that while stronger LLMs face greater safety risks, they also possess a greater capacity to be steered towards defending against such attacks, both because of their stronger ability in instruction following. Our work thus contributes to the comprehension of jailbreaking attacks and defenses, and sheds light on the relationship between LLMs' capability and safety. Our code is available at \url{https://github.com/thu-coai/JailbreakDefense_GoalPriority}.

研究の動機と目的

  • 脱法攻撃の成功要因が、LLMsにおける助けの目標と安全性の目標の間に解消されていない対立に起因することを特定すること。
  • SFT や RLHF などのアライメント技術の進展にもかかわらず、脱法攻撃に対する有効な防御が不足している問題に対処すること。
  • 推論段階および学習段階の両方で、安全性を助けの優先順位よりも高く設定する防御メカニズムを開発すること。
  • 学習時に脱法プロンプトが使用されていない場合でも、分布外(OOD)の脱法攻撃に一般化できる能力を評価すること。
  • LLMの能力と安全性の関係を調査し、特により強力なモデルがより脆弱であるか、あるいはより効果的に安全性に誘導できるかを明らかにすること。

提案手法

  • 推論段階で目的優先を組み込むためのプラグアンドプレイ型プロンプト戦略を設計し、ユーザーのクエリに安全性を優先する明確な目的指示をペアで与える。
  • モデルが応答を生成する前に、目的優先(安全性 > 助け)を特定する二段階のプロンプトフレームワークを採用する。
  • 学習段階では、悪意のある指示と善良な指示の混合データを用いて微調整することで、目的優先を統合し、安全性が優先されることを明示的に学習させる。
  • 防御性能への影響を評価するため、有害クエリの割合(1%、3%、5%)を制御したデータを訓練データに含める。
  • 防御手法は、分布内および分布外の脱法プロンプトに対して、攻撃成功率(ASR)と防御成功率(DSR)を用いて評価される。
  • APIベースおよびオープンソースのモデルを含む、ChatGPT、Vicuna、Llama2、Alpaca などの複数のLLMにこの手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1SFT や RLHF といった標準的なアライメント手法は、安全性の向上を図っているものの、なぜ脱法攻撃に対して防御に失敗するのか?
  • RQ2安全性を主たる目的として明示的に設定することで、脱法攻撃の成功率を顕著に低下させられるか?
  • RQ3モデルの微調整なしに推論段階でのみ目的優先を適用した場合、その有効性はどの程度か?
  • RQ4未観測の分布外脱法攻撃に対し、目的優先はどの程度一般化能力を向上させるか?
  • RQ5モデルの能力と脱法攻撃に対する脆弱性には相関があるか。より強力なモデルは、安全性により効果的に誘導可能か?

主な発見

  • ChatGPTに対して推論段階で目的優先を適用した場合、攻撃成功率(ASR)は66.4%から2.0%に低下し、脱法攻撃成功率が97%も減少した。
  • Vicuna-33Bに対しても同様に、ASRは68.2%から19.4%に低下し、異なるモデル間でも高い耐性を示した。
  • 目的優先を学習段階で適用したLlama2-13Bは、ASRがわずか6.6%にまで低下した。標準的なSFTと比較すると脆弱性が90.7%も減少した。
  • 学習に脱法プロンプトを一切含めない状況でも、ASRは71.0%から34.0%に低下した。これは、目的優先が単純な有害指示からのみ学習可能であることを示している。
  • 分布外(OOD)の脱法攻撃に対しても防御は良好に一般化される:学習時に脱法プロンプトを含めない状況でも、SFTに比べ22.8%、ヴァナイルSFTに比べ30%のDSR向上を達成した。
  • データ効率性も優れている:目的優先を適用した1%の有害クエリでさえ、SFTに比べ5%の有害クエリを用いた場合よりも低いASRを達成しており、データ利用効率の優位性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。