Skip to main content
QUICK REVIEW

[论文解读] Dynamic Planning in Open-Ended Dialogue using Reinforcement Learning

Deborah A. Cohen, Moonkyung Ryu|arXiv (Cornell University)|Jul 25, 2022
Speech and dialogue systems被引用 7
一句话总结

本文提出了一种基于强化学习(RL)的对话系统,利用最先进的(SOTA)语言模型对对话历史进行嵌入,并通过随机的、动态演化的动作空间实现动态响应规划。该系统在众包数据上进行训练,并已部署于Google Assistant,显著优于SOTA的监督式Transformer基线模型,对话长度提升20%,明确的正面反馈提升32%,负面反馈减少18%。

ABSTRACT

Despite recent advances in natural language understanding and generation, and decades of research on the development of conversational bots, building automated agents that can carry on rich open-ended conversations with humans "in the wild" remains a formidable challenge. In this work we develop a real-time, open-ended dialogue system that uses reinforcement learning (RL) to power a bot's conversational skill at scale. Our work pairs the succinct embedding of the conversation state generated using SOTA (supervised) language models with RL techniques that are particularly suited to a dynamic action space that changes as the conversation progresses. Trained using crowd-sourced data, our novel system is able to substantially exceeds the (strong) baseline supervised model with respect to several metrics of interest in a live experiment with real users of the Google Assistant.

研究动机与目标

  • 开发一种实时、可扩展的对话系统,能够在真实场景中实现丰富且开放的对话。
  • 应对开放域对话中大规模状态空间、无界动态动作空间以及复杂奖励设计的挑战。
  • 通过结合SOTA监督式语言模型与专为动态动作集设计的先进强化学习算法,实现在对话中的动态规划。
  • 在真实生产环境(Google Assistant)中评估并部署基于强化学习的智能体,并与SOTA监督模型进行严格对比。
  • 揭示现代强化学习算法在真实世界开放域对话场景中相对性能的洞察。

提出的方法

  • 使用预训练的监督式语言模型(RNN和Transformer)生成对话历史的紧凑且信息丰富的嵌入,作为强化学习的状态表示。
  • 在每一轮对话中将动作空间限制为一个小型、动态生成的候选响应集合,从而实现高效且可扩展的强化学习训练。
  • 采用一种专为随机、时变动作集设计的新颖强化学习框架,使智能体能够实时规划并自适应调整响应。
  • 应用最先进的强化学习算法,包括保守Q学习(CQL)、离策略评估以及连续动作优化,以提升样本效率和策略稳定性。
  • 使用众包数据中的人类反馈信号进行策略训练,包括明确的正向/负向反馈以及协作性响应指标。
  • 将最终模型部署于Google Assistant中,具体应用于动物领域体验,并在真实用户交互中进行评估。

实验结果

研究问题

  • RQ1强化学习能否在大规模部署的开放域多轮对话系统中有效实现动态实时规划?
  • RQ2利用SOTA语言模型学习到的紧凑状态表示,对基于强化学习的对话智能体性能有何影响?
  • RQ3现代离策略与保守强化学习算法在开放域对话中在多大程度上提升了样本效率与策略稳定性?
  • RQ4允许动态演化的动作空间——即每轮生成候选响应——是否能带来比固定动作集更好的用户参与度与对话质量?
  • RQ5在开放域对话中,诸如非合作响应增加等反直觉行为,是否可能带来更长期的用户满意度提升?

主要发现

  • 基于强化学习的智能体在真实用户实验中显著优于SOTA监督式Transformer基线模型,平均对话长度提升了20%。
  • 明确的正面反馈提升了32%,负面反馈减少了18%,表明用户满意度有明显改善。
  • SAQL-RNN模型每轮对话生成的唯一内容提供者数量比监督模型多26%,表明内容多样性更高。
  • 强化学习智能体选择了31%更多的基于事实的内容,更倾向于选择深度丰富对话而非浅层内容,尽管后者本身出现频率较低。
  • 尽管对机器人问题的协作率下降了9.5%,但整体用户体验因更优的长期参与度与规划能力而得到改善。
  • 该模型在基于事实的对话中,焦点切换轮次增加了60%,表明在内容更丰富的路径中具备更优的深度管理能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。