Skip to main content
QUICK REVIEW

[论文解读] Joint System-Wise Optimization for Pipeline Goal-Oriented Dialog System

Zichuan Lin, Jing Huang|arXiv (Cornell University)|Jun 9, 2021
Topic Modeling参考文献 44被引用 4
一句话总结

本文提出了一种针对流水线目标导向对话系统的联合端到端优化方法,引入了自动数据增强以提升NLU训练效果,采用泊松分布的随机策略以增强探索能力,并设计了奖励奖励机制以引导策略向成功对话轮次靠拢。该方法在MultiWOZ 2.1上的系统级评估中取得了93.8%的成功率,人类评估的成功率较之前工作高出16%。

ABSTRACT

Recent work (Takanobu et al., 2020) proposed the system-wise evaluation on dialog systems and found that improvement on individual components (e.g., NLU, policy) in prior work may not necessarily bring benefit to pipeline systems in system-wise evaluation. To improve the system-wise performance, in this paper, we propose new joint system-wise optimization techniques for the pipeline dialog system. First, we propose a new data augmentation approach which automates the labeling process for NLU training. Second, we propose a novel stochastic policy parameterization with Poisson distribution that enables better exploration and offers a principled way to compute policy gradient. Third, we propose a reward bonus to help policy explore successful dialogs. Our approaches outperform the competitive pipeline systems from Takanobu et al. (2020) by big margins of 12% success rate in automatic system-wise evaluation and of 16% success rate in human evaluation on the standard multi-domain benchmark dataset MultiWOZ 2.1, and also outperform the recent state-of-the-art end-to-end trained model from DSTC9.

研究动机与目标

  • 解决流水线对话系统中组件级改进无法转化为整体性能提升的瓶颈问题。
  • 通过从对话行为逆向生成实现自动标注,缓解NLU训练中的数据稀缺问题。
  • 通过引入基于泊松分布的新型随机策略参数化方法,提升策略探索能力与成功概率。
  • 通过引入奖励奖励机制,引导策略探索成功对话轨迹,从而提升整体系统性能。
  • 在MultiWOZ 2.1上的自动评估与人类评估中,优于竞争性的流水线系统与当前最优的端到端模型。

提出的方法

  • 提出一种数据增强技术,利用预训练的用户NLG模型从对话行为生成多样化话语,随后使用这些合成的“话语-行为”对训练系统NLU模块。
  • 引入一种基于泊松分布的随机策略网络参数化方法,以控制对话行为的数量,并在训练过程中实现更有效的探索。
  • 设计一种奖励奖励机制,鼓励策略探索成功对话轮次,减少下游NLU中的错误,提升策略泛化能力。
  • 在系统级优化框架下联合训练NLU与策略模块,同时保持DST与NLG模块与基于规则的基线一致。
  • 采用基于议程的用户模拟器进行系统级评估,通过数据库槽位匹配来衡量成功概率。
  • 结合所提出的随机策略与奖励奖励机制,使用策略梯度方法对策略进行端到端优化,以实现系统级成功目标。

实验结果

研究问题

  • RQ1流水线目标导向对话系统中的主要瓶颈是什么,导致组件级改进无法转化为整体性能提升?
  • RQ2基于逆向NLG生成的自动数据增强是否能在低资源环境下显著提升NLU性能?
  • RQ3与确定性策略或标准随机策略相比,基于泊松分布的随机策略参数化是否能带来更优的探索能力与更高的成功率?
  • RQ4一种鼓励探索成功对话轮次的奖励奖励机制,是否能提升策略泛化能力与整体系统成功率?
  • RQ5在多领域真实场景下,NLU与策略的联合系统级优化方法相较于当前最优的端到端模型表现如何?

主要发现

  • 所提方法在MultiWOZ 2.1上的自动系统级评估中达到93.8%的成功率,较基于规则的基线高出12个百分点。
  • 在人类评估中,该方法的成功率较基线系统高出16%,表明其在真实场景中具有更优的性能表现。
  • 消融实验表明,仅使用数据增强即可带来10个百分点的成功率提升,说明NLU是流水线系统中的主要瓶颈。
  • 基于泊松分布的策略相比基线策略提升3%的成功率,证明了在动作选择中引入可控随机性具有显著优势。
  • 奖励奖励机制额外带来3%的性能提升,表明引导探索向成功轨迹靠拢可显著提升学习效率。
  • S-PPO模型在多领域任务中具有良好可扩展性,即使在领域数从1增至3时仍保持高性能,而基线方法则出现显著性能下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。