Skip to main content
QUICK REVIEW

[论文解读] Budgeted Policy Learning for Task-Oriented Dialogue Systems

Zhirui Zhang, Xiujun Li|arXiv (Cornell University)|Jun 2, 2019
Speech and dialogue systems参考文献 30被引用 19
一句话总结

本文提出 BCS-DDQ,一种注重预算的调度框架,通过智能分配固定数量的真实用户交互,提升任务导向对话系统中的样本效率。通过整合基于泊松分布的调度器、主动用户目标采样以及动态控制器,BCS-DDQ 在有限的人机交互预算下,在电影票预订任务中的成功率超越了当前最先进(SOTA)基线模型。

ABSTRACT

This paper presents a new approach that extends Deep Dyna-Q (DDQ) by incorporating a Budget-Conscious Scheduling (BCS) to best utilize a fixed, small amount of user interactions (budget) for learning task-oriented dialogue agents. BCS consists of (1) a Poisson-based global scheduler to allocate budget over different stages of training; (2) a controller to decide at each training step whether the agent is trained using real or simulated experiences; (3) a user goal sampling module to generate the experiences that are most effective for policy learning. Experiments on a movie-ticket booking task with simulated and real users show that our approach leads to significant improvements in success rate over the state-of-the-art baselines given the fixed budget.

研究动机与目标

  • 解决在训练有效任务导向对话智能体时真实用户交互受限的挑战。
  • 减少策略学习中模拟用户与真实用户行为之间的差异。
  • 通过战略性地选择高影响力训练经验,提升强化学习中的样本效率。
  • 将人类示范与主动学习整合到 Deep Dyna-Q 框架中,以在预算约束下实现更优的策略优化。
  • 在模拟环境与真实用户设置下,实证验证所提出框架的有效性。

提出的方法

  • 基于泊松分布的全局调度器,动态分配固定预算的真实用户交互至不同训练阶段。
  • 主动用户目标采样模块选择未探索或此前失败的用户目标,以生成高影响力训练经验。
  • 控制器在每一步决策:是否收集真实的人机对话、进行人机交互,或通过世界模型生成模拟体验。
  • 世界模型基于真实经验进行训练,并用于生成高质量的模拟交互,以实现间接强化学习。
  • 对话策略通过直接强化学习(基于真实数据)和间接规划(基于模拟数据)双重方式更新。
  • 该框架在 Deep Dyna-Q 的基础上引入注重预算的调度机制,以在固定交互预算下提升样本效率与策略性能。

实验结果

研究问题

  • RQ1如何在对话策略训练的不同阶段,最优地分配固定且少量的真实用户交互?
  • RQ2哪些用户目标最有效于提升策略性能,以及如何主动选择它们?
  • RQ3在低预算设置下,将人类示范整合到训练过程中在多大程度上提升了样本效率?
  • RQ4在固定交互预算下,所提出的注重预算的调度机制在多大程度上优于标准强化学习与 DDQ 基线?
  • RQ5主动采样与预算分配在提升策略学习效率方面,各自贡献如何?

主要发现

  • 在固定 200 次真实用户交互预算下,BCS-DDQ 显著优于当前最先进(SOTA)基线模型(包括 DQN 和 DDQ),成功率大幅提升。
  • BCS-DDQ 智能体在所有测试案例中均成功完成购票,而 DDQ 智能体因反复进行无意义的影院可预订性询问而失败。
  • 消融实验表明,主动采样对性能的贡献大于预算分配;当用随机采样替代主动采样时,性能显著下降。
  • BCS-DDQ 的学习曲线在整个训练过程中持续优于 DQN 和 DDQ,证实了其持续改进的能力。
  • BCS-DDQ 中的控制器有效平衡了真实交互、人类示范与模拟体验的使用,从而实现更快收敛与更高成功率。
  • 人机协同实验表明,与 DDQ 相比,BCS-DDQ 生成的对话更自然、更准确,且能更有效地完成任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。