Skip to main content
QUICK REVIEW

[论文解读] SteerLM: Attribute Conditioned SFT as an (User-Steerable) Alternative to RLHF

Yi Dong, Zhilin Wang|arXiv (Cornell University)|Oct 9, 2023
Topic ModelingComputer Science被引用 3
一句话总结

SteerLM 提出了一种基于属性条件化监督微调(SFT)的用户可调控语言模型对齐方法,实现无需人类反馈强化学习(RLHF)即可实时控制响应属性(如幽默感和毒性),在 Vicuna 基准测试中达到最先进性能,优于基于 RLHF 的模型(如 ChatGPT-3.5),同时具备更简单的训练流程和更高的运行时可定制性。

ABSTRACT

Model alignment with human preferences is an essential step in making Large Language Models (LLMs) helpful and consistent with human values. It typically consists of supervised fine-tuning (SFT) and reinforcement learning from human feedback (RLHF) stages. However, RLHF faces inherent limitations stemming from a complex training setup and its tendency to align the model with implicit values that end users cannot control at run-time. Moreover, reward models in RLHF stage commonly rely on single-dimensional feedback as opposed to explicit, multifaceted signals that indicate attributes such as helpfulness, humor, and toxicity. To address these limitations, we propose SteerLM, a supervised fine-tuning method that empowers end-users to control responses during inference. SteerLM conditions responses to conform to an explicitly defined multi-dimensional set of attributes, thereby empowering a steerable AI capable of generating helpful and high-quality responses while maintaining customizability. Experiments show that SteerLM trained on open source datasets generates responses that are preferred by human and automatic evaluators to many state-of-the-art baselines trained with RLHF while being much easier to train. Try SteerLM at https://huggingface.co/nvidia/SteerLM-llama2-13B

研究动机与目标

  • 解决 RLHF 的局限性,包括训练复杂、缺乏运行时控制以及偏好信号单一化的问题。
  • 开发一种更简单、可扩展的 RLHF 替代方案,通过多维属性条件化保持高响应质量。
  • 赋予终端用户通过可调节属性(如幽默感和毒性)在运行时控制模型行为的能力。
  • 证明基于预测属性的 SFT 可在标准基准测试中达到或超越 RLHF 的性能。
  • 通过开源、用户可调控的微调方式,实现可定制、高质量且可控的 AI 助手。

提出的方法

  • 训练一个属性预测模型,从 Open-Assistant 数据集中的响应文本对中预测多维属性(如帮助性、幽默感、毒性)。
  • 通过将提示词与响应及其预测属性配对,构建用于监督学习的微调数据集。
  • 使用标准语言建模范式对语言模型进行微调,微调时同时依赖输入提示词和推理时指定的属性值。
  • 在训练过程中引入数据增强策略,包含去噪、多样化且高质量的响应样本,以提升模型鲁棒性与生成质量。
  • 通过允许用户在不重新训练的情况下指定属性值(如毒性值 0–9),实现在推理阶段的运行时控制。
  • 利用 NVIDIA NeMo 工具包实现开源代码与训练可复现性。

实验结果

研究问题

  • RQ1属性条件化 SFT 是否能在无需复杂奖励建模的情况下,优于基于 RLHF 的模型在响应质量与人类偏好上的表现?
  • RQ2用户是否能在不重新训练的前提下,在推理阶段控制如幽默感和毒性等特定属性?
  • RQ3与单一维度奖励信号相比,多维属性条件化是否能进一步提升模型对齐效果?
  • RQ4SteerLM 在 Vicuna 等标准基准测试中的表现如何,相较于最先进 RLHF 模型?
  • RQ5纯 SFT 方法是否能在保持性能竞争力的同时,比 RLHF 更简单、更易访问?

主要发现

  • SteerLM 43B 在 Vicuna 基准测试中,无论是自动评估还是人工评估,均优于当前最先进基线模型,包括基于 RLHF 的 ChatGPT-3.5。
  • 人工评估者更偏好 SteerLM 的响应,表明其与人类偏好具有更强的一致性。
  • 当设置为 0(默认)时,SteerLM 43B 在 Anthropic Red Team 数据集上的毒性值为 0.06346,低于 ChatGPT-3.5 的 0.06622。
  • 将毒性属性从 0 提升至 9 后,平均 Perspective API 毒性评分从 0.06346 上升至 0.10408,证明了有效控制能力。
  • 当幽默度设为 9 时,SteerLM 会生成笑话和俏皮话语;而较低值(≤6)则生成非笑话类响应,表明幽默感可被有效控制。
  • 该模型在多样化的提示词(如“如何度过充实的一天?”)下仍能保持高质量、有帮助的响应,并根据属性设置动态调整语气。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。