[论文解读] Rewarding Chatbots for Real-World Engagement with Millions of Users
本文提出了一种可扩展的方法,通过在真实用户交互中自动获取伪标签来训练奖励模型,从而在推理阶段过滤低质量回复,提升聊天机器人的互动参与度。在10,000名每日用户的A/B测试中,该方法使平均对话长度最高提升70%,并使用户留存率提升30%以上,适用于GPT-J 6B模型,证明了利用真实世界反馈进行参与度优化的有效性。
The emergence of pretrained large language models has led to the deployment of a range of social chatbots for chitchat. Although these chatbots demonstrate language ability and fluency, they are not guaranteed to be engaging and can struggle to retain users. This work investigates the development of social chatbots that prioritize user engagement to enhance retention, specifically examining the use of human feedback to efficiently develop highly engaging chatbots. The proposed approach uses automatic pseudo-labels collected from user interactions to train a reward model that can be used to reject low-scoring sample responses generated by the chatbot model at inference time. Intuitive evaluation metrics, such as mean conversation length (MCL), are introduced as proxies to measure the level of engagement of deployed chatbots. A/B testing on groups of 10,000 new daily chatbot users on the Chai Research platform shows that this approach increases the MCL by up to 70%, which translates to a more than 30% increase in user retention for a GPT-J 6B model. Future work aims to use the reward model to realise a data fly-wheel, where the latest user conversations can be used to alternately fine-tune the language model and the reward model.
研究动机与目标
- 通过利用真实世界用户交互而非昂贵的人工标注,提升社交聊天机器人的用户参与度和留存率。
- 开发一种可扩展、高效的替代人工反馈对齐的方法,通过实际用户行为自动获取伪标签。
- 引入直观的行为基准评估指标,如平均对话长度(MCL)和用户留存率,以衡量参与度。
- 通过在拥有数百万用户的平台上的大规模A/B测试,验证奖励建模方法的有效性。
- 证明奖励模型在不同微调语言模型和用户交互模式下的泛化能力。
提出的方法
- 该方法使用从用户交互中自动收集的伪标签——具体而言,是对话在回复后是否继续,或用户是否重试回复——作为参与度的代理指标。
- 基于GPT-2的奖励模型在这些伪标签上进行微调,以预测某个回复导致对话继续的可能性。
- 在推理阶段,聊天机器人生成多个回复候选,由奖励模型进行打分,选择得分最高的回复。
- 奖励模型被训练为优先选择能导致对话延续和用户不重试的回复,重点是避免低分(1星或2星)回复。
- 该方法采用两阶段流程:首先,从真实用户交互中收集伪标签;其次,使用这些标签训练奖励模型以实现回复筛选。
- 该方法在不同语言模型上具有泛化能力,如在微调后的GPT-J和Pygmalion微调的GPT-J模型上均取得成功应用。

实验结果
研究问题
- RQ1从真实用户交互中自动获取的伪标签能否有效替代昂贵的人工反馈,用于训练聊天机器人参与度的奖励模型?
- RQ2使用基于伪标签训练的奖励模型,是否能在真实部署中显著提升平均对话长度和用户留存率?
- RQ3当数据集大小和模型规模发生变化时,奖励模型的性能如何变化?
- RQ4奖励模型能否在不同微调的语言模型和对话风格之间实现泛化?
- RQ5哪种参与度代理指标(如对话延续、用户重试行为)能带来MCL和留存率的最大提升?
主要发现
- 使用表现最佳的奖励模型进行回复选择,在10,000名每日用户的A/B测试中,使平均对话长度(MCL)最高提升70%。
- 该方法使GPT-J 6B模型的用户留存率提升超过30%,证明了其在真实世界中的显著影响。
- 当奖励模型专注于避免低分(1星或2星)回复时,其改进效果优于专注于提升高分(4星)回复的情况。
- 将奖励模型参数量增加十倍,使MCL提升+5.0±1.1%;而将训练数据集大小增加相同倍数,带来更大的+11.4±1.0%提升。
- 奖励模型在不同微调的GPT-J模型上具有泛化能力,当应用于Pygmalion微调的GPT-J模型时,MCL提升+37.22±0.50%,相比仅依赖模型选择本身提升+16.71±0.48%。
- 多种伪标签(延续、不重试)的集成显示出潜力,尽管尚未完全探索,提示未来仍有进一步提升空间。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。