[论文解读] RLCD: Reinforcement Learning from Contrastive Distillation for Language Model Alignment
RLCD 提出了一种新颖的方法,无需人类反馈即可对齐语言模型,通过对比提示(contrastive prompting)生成合成偏好对:它使用正向和负向提示生成对比输出,并自动将正向输出标记为偏好结果。该方法减少了标签噪声,并在 7B 和 30B 参数规模的语言模型上,在无害性、帮助性以及故事生成任务中,相较于 RLAIF 和上下文蒸馏基线方法,提升了对齐性能。
We propose Reinforcement Learning from Contrastive Distillation (RLCD), a method for aligning language models to follow principles expressed in natural language (e.g., to be more harmless) without using human feedback. RLCD creates preference pairs from two contrasting model outputs, one using a positive prompt designed to encourage following the given principles, and one using a negative prompt designed to encourage violating them. Using two different prompts causes model outputs to be more differentiated on average, resulting in cleaner preference labels in the absence of human annotations. We then use the preference pairs to train a preference model, which is in turn used to improve a base unaligned language model via reinforcement learning. Empirically, RLCD outperforms RLAIF (Bai et al., 2022b) and context distillation (Huang et al., 2022) baselines across three diverse alignment tasks--harmlessness, helpfulness, and story outline generation--and when using both 7B and 30B model scales for simulating preference data.
研究动机与目标
- 为解决收集人类标注偏好数据在语言模型对齐任务中成本高昂且可扩展性受限的问题。
- 通过减少标签噪声,提升强化学习中使用的合成偏好数据质量。
- 在单一框架中结合 RLAIF(成对偏好)和上下文蒸馏(方向性属性控制)的优势。
- 仅使用大语言模型生成的偏好信号,实现大语言模型的有效对齐。
- 证明对比提示工程可生成比标准 RLAIF 或上下文蒸馏更高质量的偏好数据。
提出的方法
- 生成两个对比提示:正向提示 $p_{+}$ 鼓励期望属性(如帮助性),负向提示 $p_{-}$ 则抑制该属性。
- 使用基础语言模型分别从 $p_{+}$ 和 $p_{-}$ 生成输出 $(o_{+}, o_{-})$。
- 自动将 $o_{+}$ 标记为偏好输出,$o_{-}$ 标记为非偏好输出,形成合成成对偏好数据。
- 在生成的合成偏好对上训练偏好模型,以预测输出质量的相对优劣。
- 使用偏好模型的奖励信号,通过 PPO 对目标语言模型进行微调。
- 使用同一模型同时生成偏好对和执行对齐,实现可扩展的、无需反馈的训练。
实验结果
研究问题
- RQ1通过对比提示生成的合成偏好对是否在对齐质量上优于标准 RLAIF?
- RQ2与标准 RLAIF 相比,使用正向和负向提示是否能提升偏好数据的信噪比?
- RQ3对比蒸馏能否在保持成对强化学习优势的同时,实现优于上下文蒸馏的对齐效果?
- RQ4RLCD 在多种对齐任务(如无害性、帮助性及创造性生成)中的表现如何?
- RQ5该方法在更大模型规模(如 30B)下是否能有效扩展,且无需人类反馈?
主要发现
- 在所有三项对齐任务(无害性、帮助性、故事提纲生成)中,RLCD 在人类评估中均优于 RLAIF 和上下文蒸馏基线方法。
- 在 7B 模型规模下,RLCD 在成对比较中表现更优,表明其偏好信号质量更高。
- 在 30B 模型规模下,RLCD 维持或超越了基线方法的性能,证明了其可扩展性。
- 通过确保 $o_{+}$ 和 $o_{-}$ 之间更大的质量差异,该方法减少了标签噪声,从而提升了偏好建模的可靠性。
- 与仅使用正向信号的上下文蒸馏相比,同时使用正向和负向提示提供了更丰富的监督信号。
- 该方法实现了无需人类反馈的有效对齐,适用于大规模、低成本的大语言模型对齐。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。