[论文解读] Keeping LLMs Aligned After Fine-tuning: The Crucial Role of Prompt Templates
本文提出了纯微调安全测试(Pure Tuning, Safe Testing, PTST)原则,以在大语言模型微调后保持安全对齐。通过在微调阶段不使用安全提示,仅在推理阶段应用安全提示,PTST显著减少甚至消除了不安全行为——即使在使用Alpaca和GSM8K等良性数据集微调的模型中也是如此——同时保持强大的下游性能。
Public LLMs such as the Llama 2-Chat underwent alignment training and were considered safe. Recently Qi et al. [2024] reported that even benign fine-tuning on seemingly safe datasets can give rise to unsafe behaviors in the models. The current paper is about methods and best practices to mitigate such loss of alignment. We focus on the setting where a public model is fine-tuned before serving users for specific usage, where the model should improve on the downstream task while maintaining alignment. Through extensive experiments on several chat models (Meta's Llama 2-Chat, Mistral AI's Mistral 7B Instruct v0.2, and OpenAI's GPT-3.5 Turbo), this paper uncovers that the prompt templates used during fine-tuning and inference play a crucial role in preserving safety alignment, and proposes the ``Pure Tuning, Safe Testing'' (PTST) strategy -- fine-tune models without a safety prompt, but include it at test time. This seemingly counterintuitive strategy incorporates an intended distribution shift to encourage alignment preservation. Fine-tuning experiments on GSM8K, ChatDoctor, and OpenOrca show that PTST significantly reduces the rise of unsafe behaviors.
研究动机与目标
- 探究为何在看似良性的数据集上微调对齐的大语言模型会导致安全性能下降。
- 识别提示模板在微调期间及之后保持安全对齐中的作用。
- 提出一种实用方法,在保持模型有用性的同时,最大限度减少微调后的不安全行为。
- 评估PTST在多个大语言模型(包括Llama 2-Chat、Mistral 7B Instruct和GPT-3.5 Turbo)上的有效性。
- 提供实证证据表明,可利用微调与推理模板之间的分布差异来提升安全性。
提出的方法
- 仅使用用户指令和输入进行大语言模型微调,微调阶段完全省略任何安全提示。
- 在推理阶段应用标准化的安全提示,即使模型在微调时未使用该提示。
- 在所有实验中使用相同的提示模板进行推理,以确保对安全性的评估一致。
- 使用来自AdvBench和DirectHarm4等基准的对抗性提示测量安全性能下降,指标为攻击成功率(ASR)。
- 将PTST与标准微调方法进行对比,后者在微调和推理阶段均使用相同的提示模板。
- 在多个数据集(GSM8K、ChatDoctor、OpenOrca)和模型上开展消融研究,以验证方法的鲁棒性。
实验结果
研究问题
- RQ1在微调阶段使用安全提示是否会导致模型安全对齐性能下降,即使训练数据是良性的?
- RQ2在微调阶段移除安全提示,而在推理阶段保留,是否能改善微调后的安全性?
- RQ3微调阶段选择的提示模板如何影响模型对不同推理模板的泛化能力?
- RQ4与标准微调相比,PTST在多大程度上降低了有害查询的攻击成功率?
- RQ5为何在微调时不使用安全提示,反而能带来比使用安全提示更好的安全泛化效果?
主要发现
- PTST显著降低了有害查询的攻击成功率(ASR),在某些情况下近乎完全消除了不安全行为。
- 即使在良性数据集(如Alpaca)上微调,使用安全提示也会导致安全性能下降,使模型比未使用安全提示微调的模型更不安全。
- 在GSM8K数据集上,PTST在保持高帮助性(AlpacaEval得分为78.5)的同时,将ASR从标准微调的42.5%降低至12.5%。
- 在ChatDoctor基准中,PTST将ASR从标准微调的35.0%降低至10.0%。
- 即使在微调数据集中包含安全对齐示例的情况下,PTST仍相比标准实践提供了可测量的安全性提升。
- 结果表明,微调阶段的安全提示可能干扰已学习的对齐机制,而微调阶段省略安全提示,反而能促进推理阶段更好的安全泛化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。