Skip to main content
QUICK REVIEW

[论文解读] Towards Unsupervised Language Understanding and Generation by Joint Dual Learning

Shang‐Yu Su, Chao-Wei Huang|arXiv (Cornell University)|Apr 30, 2020
Topic Modeling参考文献 30被引用 5
一句话总结

本文提出一种通用的联合对偶学习框架,利用自然语言理解(NLU)与自然语言生成(NLG)之间的结构对偶性,实现监督学习与无监督学习的灵活整合。通过在NLU与NLG模型之间形成循环训练——每个模型生成的输出用于重建原始输入——该框架在两个任务上均提升了性能,在同时具备监督信号与强化学习信号的基准数据集上取得了最先进结果。

ABSTRACT

In modular dialogue systems, natural language understanding (NLU) and natural language generation (NLG) are two critical components, where NLU extracts the semantics from the given texts and NLG is to construct corresponding natural language sentences based on the input semantic representations. However, the dual property between understanding and generation has been rarely explored. The prior work is the first attempt that utilized the duality between NLU and NLG to improve the performance via a dual supervised learning framework. However, the prior work still learned both components in a supervised manner, instead, this paper introduces a general learning framework to effectively exploit such duality, providing flexibility of incorporating both supervised and unsupervised learning algorithms to train language understanding and generation models in a joint fashion. The benchmark experiments demonstrate that the proposed approach is capable of boosting the performance of both NLU and NLG.

研究动机与目标

  • 解决在无监督学习设置下,对NLU与NLG之间对偶关系探索不足的问题。
  • 开发一种通用的学习框架,统一NLU与NLG模块的监督与无监督训练。
  • 通过联合优化,利用NLU与NLG的结构对偶性,提升两者性能。
  • 探究不同强化学习信号(如词元级似然、自动指标、联合分布估计)在对偶学习框架中的有效性。

提出的方法

  • 该框架采用对偶循环:原始循环从语义框架开始,通过NLG生成文本,并通过NLU重建原始框架;对偶循环则反向进行,从话语开始,重建语义。
  • 模型通过监督损失与强化学习目标的组合进行训练,梯度在两个循环中反向传播。
  • 强化学习信号在两个位置应用:循环中段(对NLG输出)与循环末端(对NLU重建结果),具有不同的梯度目标。
  • 该框架与具体架构无关,可与各种模型集成,如带有全连接层的GRU。
  • 评估了不同奖励函数:词元级似然、句子/框架级自动指标(如BLEU、ROUGE),以及通过MADE实现的语料级联合分布估计。
  • 训练过程在算法1中形式化,交替执行两个循环的前向与反向传播,以同时优化两个模型。

实验结果

研究问题

  • RQ1NLU与NLG之间的对偶性是否可在无监督或弱监督设置下被有效利用以提升性能?
  • RQ2通过联合对偶学习训练相比独立训练,对NLU与NLG性能的影响如何?
  • RQ3在对偶学习框架中,哪种强化学习信号——词元级、句子级或基于分布的——能带来最佳性能提升?
  • RQ4所提出的框架是否能在统一训练方案中同时支持监督与无监督学习策略?

主要发现

  • 所提出的对偶学习框架在基准数据集上显著提升了NLU与NLG的性能,优于独立训练的基线模型。
  • 使用句子级或框架级自动评估指标(如BLEU、ROUGE)作为强化学习奖励,可获得最佳性能,表明直接优化评估指标有助于提升生成质量。
  • 通过MADE进行联合分布估计的模型也表现出性能提升,表明数据分布的隐式反馈有助于增强NLU的鲁棒性。
  • 词元级似然信号带来的附加收益有限,表明其在引导学习过程方面不如高层指标有效。
  • 定性分析表明,该框架在两个循环中成功保留了语义内容,双重转换过程中信息损失极小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。