[论文解读] Personalized Language Modeling from Personalized Human Feedback
本文提出个性化强化学习人类反馈(P-RLHF)框架,联合学习用户模型与个性化语言/奖励模型,以实现大语言模型与个体用户偏好的对齐。通过引入用户特定嵌入及针对个性化奖励建模(P-RM)和直接偏好优化(P-DPO)的新型学习目标,该方法在已见与未见用户上均提升了对齐效果,在个性化偏好预测任务中最高达到61.72%的准确率,优于非个性化基线方法。
Personalized large language models (LLMs) are designed to tailor responses to individual user preferences. While Reinforcement Learning from Human Feedback (RLHF) is a commonly used framework for aligning LLMs with human preferences, vanilla RLHF assumes that all human preferences share the same distribution, preventing fine-tuned LLMs from generating personalized content when user preferences are diverse. In this work, we propose Personalized-RLHF (P-RLHF), an efficient framework that utilizes a lightweight user model to capture individual user preferences and jointly learns the user model and the personalized LLM from human feedback. P-RLHF exhibits the following three characteristics: (1) It enables an LLM to generate personalized content and scale efficiently with growing number of users. (2) It handles both explicit user preferences described as textual input and implicit user preferences encoded in the feedback data. (3) It eliminates the need for users to fully articulate their preferences, which are normally needed for prompting LLMs to generate personalized content yet are often impractical to obtain in real-world scenarios. Our experimental results show that personalized LLMs trained using P-RLHF generate responses that are more closely aligned with individual user preferences, outperforming vanilla, non-personalized RLHF and prompting-based personalization approaches across different tasks. We opensource our code at https://github.com/HumainLab/Personalized_RLHF.
研究动机与目标
- 解决原始RLHF在处理大语言模型中多样化个性化人类偏好时的局限性。
- 形式化学习个性化人类反馈的任务,其中个体间偏好存在显著差异。
- 开发一种通用的P-RLHF框架,联合学习用户表征与个性化奖励/语言模型。
- 为个性化奖励建模(P-RM)和个性化直接偏好优化(P-DPO)设计新的学习目标。
- 在带有标注用户偏好的真实世界文本摘要数据集上评估该框架,证明其在个体用户层面的对齐性能提升。
提出的方法
- 提出P-RLHF框架,利用标注用户身份的偏好数据,联合训练用户模型与语言/奖励模型。
- 设计用户模型,将用户信息(如工作者ID)映射为用户特定嵌入,支持个体或聚类式表征。
- 提出个性化奖励建模目标(P-RM),结合用户特定与用户无关的损失项,由超参数α加权。
- 开发个性化DPO目标(P-DPO),利用用户条件化的隐式奖励函数优化语言模型。
- 在P-RM与P-DPO中采用混合损失,平衡个体偏好拟合与通过通用用户表征(e₀)进行正则化,以适应未见用户。
- 采用GPT-J 6B作为基础语言模型,并在包含10名标注者的现实世界文本摘要数据集上,使用P-RM与P-DPO进行微调。
实验结果
研究问题
- RQ1统一框架能否联合学习用户表征与个性化奖励模型,从而提升与个体偏好的对齐效果?
- RQ2与非个性化基线相比,引入用户特定嵌入对偏好建模性能有何影响?
- RQ3P-RM与P-DPO目标中用户无关正则化项(α)对未见用户泛化能力的影响如何?
- RQ4不同用户模型设计(个体 vs. 聚类)对个性化性能与鲁棒性的影响如何?
- RQ5所提方法能否有效利用通用用户表征,为未见用户定制语言模型输出?
主要发现
- 采用个体用户嵌入与α=0.5的P-RM模型在已见用户的Top-1偏好预测中达到61.72%的准确率,优于基线RM模型(60.27%)。
- 采用个体用户嵌入与α=0.5的P-DPO模型在已见用户上达到61.33%准确率,在未见用户上达到61.97%准确率,均优于基线DPO模型(分别为60.48%与60.99%)。
- 用户无关损失项(α=0.5)显著提升了泛化能力,所有评估指标下α=0.5的模型均优于α=1.0的模型。
- K=5聚类的用户模型性能与个体模型相当,但方差更高,表明通过更优超参数调优或领域感知聚类仍有改进空间。
- 通用用户表征(e₀)可有效实现对未见用户的个性化,P-DPO在未见用户上达到61.97%准确率,高于基线DPO模型。
- 结果表明,通过用户表征显式建模用户偏好,相比标准RLHF方法,能更有效地实现与个体偏好的对齐。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。