Skip to main content
QUICK REVIEW

[論文レビュー] Safety Alignment Should Be Made More Than Just a Few Tokens Deep

Xiangyu Qi, Ashwinee Panda|arXiv (Cornell University)|Jun 10, 2024
Risk and Safety AnalysisDecision Sciences被引用数 3
ひとこと要約

この論文は、大規模言語モデル(LLM)の安全性が最初の数トークンに限定される「浅い安全性の整合性(shallow safety alignment)」という根本的脆弱性を特定し、これが敵対的サフィックス、デコード攻撃、ファインチューニング攻撃を通じた脱獄を可能にする要因であると示している。本稿では、データ拡張と制約付きファインチューニング目的関数を用いて整合性を深めることで、初期トークン以降の持続的でより強固な安全性を実現する手法を提案している。

ABSTRACT

The safety alignment of current Large Language Models (LLMs) is vulnerable. Relatively simple attacks, or even benign fine-tuning, can jailbreak aligned models. We argue that many of these vulnerabilities are related to a shared underlying issue: safety alignment can take shortcuts, wherein the alignment adapts a model's generative distribution primarily over only its very first few output tokens. We refer to this issue as shallow safety alignment. In this paper, we present case studies to explain why shallow safety alignment can exist and provide evidence that current aligned LLMs are subject to this issue. We also show how these findings help explain multiple recently discovered vulnerabilities in LLMs, including the susceptibility to adversarial suffix attacks, prefilling attacks, decoding parameter attacks, and fine-tuning attacks. Importantly, we discuss how this consolidated notion of shallow safety alignment sheds light on promising research directions for mitigating these vulnerabilities. For instance, we show that deepening the safety alignment beyond just the first few tokens can often meaningfully improve robustness against some common exploits. Finally, we design a regularized finetuning objective that makes the safety alignment more persistent against fine-tuning attacks by constraining updates on initial tokens. Overall, we advocate that future safety alignment should be made more than just a few tokens deep.

研究の動機と目的

  • 現在のLLMの安全性の整合性が、広範なファインチューニングやRLHFを経ても単純な攻撃に対して脆弱である理由を調査すること。
  • 安全性の整合性が最初の数トークンに限定される「浅い安全性の整合性(shallow safety alignment)」という現象を同定し、その脆弱性の根本的原因とすること。
  • 多くの既知の攻撃(例:敵対的サフィックス、プリフィル、デコードパラメータ、ファインチューニング攻撃)が、初期トークンを操作することでこの浅い整合性を悪用していることを実証すること。
  • 初期トークン以降の領域へも安全性の整合性を拡張する手法を提案し、その結果、攻撃に対する耐性が向上することを示すこと。
  • 初期トークンの確率分布の変化を制限する制約付きファインチューニング目的関数を開発し、ファインチューニングに基づく脱獄攻撃に対する耐性を高めること。

提案手法

  • 有害な初期応答に続く安全性の拒否を含むデータ拡張戦略を導入し、モデルが不安全な開始状態から回復できるように訓練する。
  • 好みモデリングに基づく正則化されたファインチューニング目的関数を提案し、アライメント済みモデルのポリシーを基準として、初期トークン確率の更新を制約する。
  • ポリシー確率比のスケーリングされた対数比のシグモイド関数を用いて、温度に類似した正規化βtを介して、シーケンス内の各位置で勾配の安定性を確保する代理目的関数を導出する。
  • Bradley-Terryモデルの枠組みを用いて、アライメント済みポリシーの平均に対する期待報酬がより高いトークンを優遇する好み関数Tを定義する。
  • 明示的な価値関数学習を必要とせず、勾配が微分可能でスケーラブルな状態を保つために、下界の代理損失Lθを用いてエンドツーエンド最適化を可能にする。
  • ファインチューニングの文脈に本手法を適用し、初期トークンの確率分布に大きなシフトが生じないよう、明示的に正則化する。

実験結果

リサーチクエスチョン

  • RQ1なぜ現在のLLMの安全性の整合性手法は、敵対的サフィックスやプリフィルといった単純な攻撃に対して脆弱なのか?
  • RQ2アライメント済みモデルの安全性行動が、本当に最初の数トークンにのみ依存しているのか、その程度はどの程度か?
  • RQ3安全性の整合性を最初の数トークンを超えて深めることで、既知の攻撃に対する耐性が向上するのか?
  • RQ4制約付きファインチューニング目的関数は、ファインチューニング攻撃による脱獄リスクをどのように軽減できるのか?
  • RQ5初期トークンの確率分布が、崩壊的整合性の失敗を促進するか、防止するかに果たす役割は何か?

主な発見

  • 現在の安全性の整合性は主に浅く、アライメント済みモデルと未アライメントモデルとの主な差異は、最初の数トークンの生成に限定されている。
  • 未アライメントモデルに「私は対応できません」といった安全なプリフィックスを単にプリフィルするだけで、完全にアライメントされたモデルと同等の安全性を達成できるため、浅い整合性の脆さが示されている。
  • 敵対的サフィックス攻撃、デコードパラメータの悪用、プリフィル攻撃は、すべて初期トークンの確率分布を操作することで成功しており、整合性が最初の数トークンを越えて安定していないことを確認している。
  • ファインチューニング攻撃では、有害応答の最初の数トークンにおける確率分布の変化が最も顕著であり、これがわずか数ステップのファインチューニングで脱獄が可能になる理由を説明している。
  • 有害な応答から安全な応答への遷移を含むデータ拡張は、整合性を深めることに成功し、アライメント済みモデルと未アライメントモデルとの間で、より深いトークン位置での乖離が増大し、耐性が向上している。
  • 初期トークン確率を正則化する本手法の制約付きファインチューニング目的関数は、ファインチューニングに基づく脱獄攻撃のリスクを顕著に低減し、実用的な防御メカニズムを提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。