Skip to main content
QUICK REVIEW

[论文解读] Dialog State Tracking with Reinforced Data Augmentation

Yichun Yin, Lifeng Shang|arXiv (Cornell University)|Aug 21, 2019
Topic Modeling参考文献 47被引用 6
一句话总结

本文提出了一种基于强化学习的对话状态追踪框架,利用上下文Bandit生成器通过数据增强生成高质量、多样化的训练数据。通过交替训练生成器(利用追踪器提供的奖励)和在增强数据上重新训练追踪器,该方法显著提升了最先进性能,尤其在WoZ和MultiWoZ数据集的低数据设置下表现突出。

ABSTRACT

Neural dialog state trackers are generally limited due to the lack of quantity and diversity of annotated training data. In this paper, we address this difficulty by proposing a reinforcement learning (RL) based framework for data augmentation that can generate high-quality data to improve the neural state tracker. Specifically, we introduce a novel contextual bandit generator to learn fine-grained augmentation policies that can generate new effective instances by choosing suitable replacements for the specific context. Moreover, by alternately learning between the generator and the state tracker, we can keep refining the generative policies to generate more high-quality training data for neural state tracker. Experimental results on the WoZ and MultiWoZ (restaurant) datasets demonstrate that the proposed framework significantly improves the performance over the state-of-the-art models, especially with limited training data.

研究动机与目标

  • 解决神经对话状态追踪器在低资源设置下因数据稀缺而限制泛化能力的问题。
  • 开发一种数据增强方法,生成流畅、语义一致且与任务相关的对话状态追踪训练实例。
  • 设计一种强化学习框架,使生成器能够基于追踪器的反馈学习生成有效的数据增强。
  • 通过交替训练生成器和追踪器实现迭代改进,随时间推移不断优化两个组件。
  • 在标注训练数据有限的基准数据集上实现最先进性能。

提出的方法

  • 采用粗到精策略:首先为输入中的特定槽位或短语生成候选替换(如同义词或改写句)。
  • 使用强化学习训练基于上下文Bandit的生成器,从候选池中选择最佳替换,依据来自追踪器的奖励。
  • 将奖励信号定义为在新生成数据上微调后追踪器性能的提升(例如联合目标准确率)。
  • 通过交替训练生成器(利用追踪器反馈)和在增强数据上重新训练追踪器,实现相互改进。
  • 将生成器应用于生成新的训练实例,随后用于微调追踪器,从而形成闭环。
  • 使用策略网络建模替换选择过程,通过上下文Bandit学习平衡探索与利用。

实验结果

研究问题

  • RQ1强化学习能否有效用于生成高质量、多样化的对话状态追踪训练数据?
  • RQ2基于追踪器反馈训练的生成器是否能产生比启发式或随机替换策略更有效的数据增强?
  • RQ3在生成器与追踪器之间交替训练是否能在低资源对话状态追踪基准上带来一致的性能提升?
  • RQ4在有限训练数据条件下,所提出的RDA框架与最先进模型相比,联合目标准确率表现如何?
  • RQ5生成实例的质量在提升追踪器泛化能力方面起到何种作用?

主要发现

  • 所提出的RDA框架在WoZ和MultiWoZ(餐厅)数据集上均实现了新的最先进性能,尤其在低数据设置下表现显著。
  • 在MultiWoZ数据集上,模型实现了58.7%的联合目标准确率,超越了相同训练数据设置下的先前SOTA模型。
  • 当仅使用10%的训练数据时,该框架显著提升了追踪器性能,展现出强大的数据效率。
  • 案例研究显示,生成器能够基于语义相关性和流畅性学习选择上下文恰当的替换(例如,选择'affordable'而非'too expensive')。
  • 消融研究证实,交替训练循环和基于强化学习的策略选择对性能提升至关重要,优于基线数据增强方法。
  • 超参数分析表明,探索率和奖励设计对生成数据质量及最终追踪器准确率有显著影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。