[论文解读] A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity
本文对直接偏好优化(DPO)在降低模型毒性方面的作用进行了机制分析,揭示出DPO并未移除有毒能力,而是通过在价值向量中学习一种分布式的偏移来绕过有毒表征。研究证明,通过放大关键有毒向量即可轻松逆转对齐效果,从而解释了为何对齐模型仍可能被越狱攻击。
While alignment algorithms are now commonly used to tune pre-trained language models towards a user's preferences, we lack explanations for the underlying mechanisms in which models become ``aligned'', thus making it difficult to explain phenomena like jailbreaks. In this work we study a popular algorithm, direct preference optimization (DPO), and the mechanisms by which it reduces toxicity. Namely, we first study how toxicity is represented and elicited in a pre-trained language model, GPT2-medium. We then apply DPO with a carefully crafted pairwise dataset to reduce toxicity. We examine how the resulting model averts toxic outputs, and find that capabilities learned from pre-training are not removed, but rather bypassed. We use this insight to demonstrate a simple method to un-align the model, reverting it back to its toxic behavior.
研究动机与目标
- 理解DPO如何在机制层面降低语言模型的毒性。
- 研究尽管对齐成功,为何对齐模型仍对越狱攻击保持脆弱。
- 检查在DPO微调过程中,有毒能力是否被移除,还是仅被绕过。
- 开发并验证一种通过重新激活有毒向量来逆转对齐的方法。
- 为偏好微调模型中对齐的脆弱性提供因果解释。
提出的方法
- 使用奇异值分解(SVD)对MLP激活向量进行分析,在GPT2-medium中识别出有毒表征。
- 利用PPLM构建成对数据集,为维基百科提示词生成成对的有毒与非有毒续写。
- 使用筛选后的成对数据对GPT2-medium应用DPO进行微调,以降低毒性。
- 在DPO前后追踪模型权重和残差流动态的变化,检测有毒向量激活的偏移。
- 通过放大关键有毒向量实施干预,以重新激活有毒输出,证明对齐已被破坏。
- 使用SVD隔离并分析模型中促进毒性的特定向量。

实验结果
研究问题
- RQ1在像GPT2-medium这样的预训练语言模型内部表征中,毒性如何被表示并被激发?
- RQ2在DPO微调后,模型的权重和激活发生了哪些具体变化?
- RQ3DPO是否移除了生成有毒输出的能力,还是仅绕过了有毒路径?
- RQ4DPO所学习的对齐是否容易被逆转?如果是,其机制是什么?
- RQ5对齐模型易受越狱攻击的机制性解释是什么?
主要发现
- 在GPT2-medium中,毒性由MLP模块中的多个独立向量表示,尤其集中在键向量和值向量中,可通过SVD分离。
- 通过从残差流中减去这些有毒向量可显著降低有毒输出,证实其具有因果作用。
- DPO微调后,权重未发生显著变化;相反,模型通过在值向量中学习一种分布式的偏移来绕过有毒区域。
- DPO模型保留了其预训练能力,但通过选择替代路径避免触发有毒表征。
- 通过放大与有毒表征相关的关键向量,可重新激活模型的原始有毒行为,从而实现对齐的逆转。
- 对齐的脆弱性并非源于有毒能力的移除,而是模型通过微小且分布式的权重偏移学习到了规避策略。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。