[论文解读] What Makes and Breaks Safety Fine-tuning? A Mechanistic Study
本文通过引入一种合成数据框架,将任务与概念解耦,以研究监督微调(SSFT)、DPO 和遗忘学习等安全方法如何改变模型激活,从而探究大语言模型中安全微调的机制基础。研究发现,安全微调通过最小化调整MLP权重,将不安全输入投影到权重矩阵的零空间中,从而在激活空间中形成安全与不安全输入的独立聚类;而对抗性越狱攻击则通过模仿安全输入的激活模式,绕过安全检测。
Safety fine-tuning helps align Large Language Models (LLMs) with human preferences for their safe deployment. To better understand the underlying factors that make models safe via safety fine-tuning, we design a synthetic data generation framework that captures salient aspects of an unsafe input by modeling the interaction between the task the model is asked to perform (e.g., "design") versus the specific concepts the task is asked to be performed upon (e.g., a "cycle" vs. a "bomb"). Using this, we investigate three well-known safety fine-tuning methods -- supervised safety fine-tuning, direct preference optimization, and unlearning -- and provide significant evidence demonstrating that these methods minimally transform MLP weights to specifically align unsafe inputs into its weights' null space. This yields a clustering of inputs based on whether the model deems them safe or not. Correspondingly, when an adversarial input (e.g., a jailbreak) is provided, its activations are closer to safer samples, leading to the model processing such an input as if it were safe. We validate our findings, wherever possible, on real-world models -- specifically, Llama-2 7B and Llama-3 8B.
研究动机与目标
- 理解安全微调如何通过机制手段使大语言模型与人类安全偏好对齐。
- 探究尽管经过训练,安全微调模型为何仍对越狱攻击保持脆弱。
- 设计一种受控的合成数据生成框架,以隔离任务-概念交互,用于研究安全行为。
- 分析不同安全微调方法(SSFT、DPO、遗忘学习)如何改变模型表征与归纳偏置。
- 通过激活相似性与权重空间变换,解释安全微调鲁棒性失效的原因。
提出的方法
- 开发了一种合成数据生成框架,将输入建模为任务(如“设计”)与概念(如“炸弹”与“自行车”)的组合,从而实现对安全行为的受控研究。
- 利用该框架生成基于Wei等人(2023)分类体系的安全、不安全及对抗性(越狱)输入。
- 训练并分析了三种安全微调方法:监督式安全微调(SSFT)、直接偏好优化(DPO)与机器遗忘学习。
- 执行线性模式连通性分析,研究权重更新($\Delta W$)如何影响各层激活空间的奇异值与投影角度。
- 通过测量局部Lipschitz常数与Fisher准则,评估微调前后激活空间中聚类的紧凑性与分离度。
- 追踪微调过程中安全与不安全样本之间特征空间经验秩及激活分布相似性的变化。
实验结果
研究问题
- RQ1安全微调方法如何在模型权重空间中转化不安全输入的表征?
- RQ2为何越狱攻击能成功绕过安全微调,尽管其训练目标是提升安全性?
- RQ3MLP权重的零空间在区分安全与不安全输入中起到何种作用?
- RQ4安全微调引入的归纳偏置如何影响模型对不安全输入的局部Lipschitz行为?
- RQ5对抗性输入在激活空间中与安全输入的相似程度如何?这种相似性如何实现规避?
主要发现
- 安全微调通过最小化调整MLP权重,将不安全输入投影至权重矩阵的零空间,从而在激活空间中形成不安全样本的独立聚类。
- 安全微调后,不安全样本的特征空间经验秩显著降低,表明其表征维度减少,紧凑性增强。
- 对抗性越狱输入的激活模式与安全输入在统计上无法区分,使其能够规避安全机制检测。
- 安全微调后,模型对不安全样本的局部Lipschitz常数降低,表明模型在不安全区域对输入扰动的敏感性下降。
- 微调后,安全与不安全样本在聚类分离上的Fisher准则显著提升,证实该方法成功在表征空间中分离了安全与不安全聚类。
- 对于不安全样本,指令微调模型与安全微调模型的激活空间间投影角增大,表明其表征经历了更显著的变换。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。