Skip to main content
QUICK REVIEW

[论文解读] Dual Supervised Learning for Natural Language Understanding and Generation

Shang‐Yu Su, Chao-Wei Huang|arXiv (Cornell University)|May 15, 2019
Topic Modeling参考文献 22被引用 6
一句话总结

本文提出了一种双监督学习框架,通过在自然语言理解(NLU)和自然语言生成(NLG)模型之间强制执行概率对偶性,联合训练这两个模型,使用一种正则化项来对齐语义和话语的联合分布。该方法在独立训练基线的基础上,同时提升了两个任务的性能,F1(NLU)和BLEU/ROUGE(NLG)得分均有显著提升。

ABSTRACT

Natural language understanding (NLU) and natural language generation (NLG) are both critical research topics in the NLP field. Natural language understanding is to extract the core semantic meaning from the given utterances, while natural language generation is opposite, of which the goal is to construct corresponding sentences based on the given semantics. However, such dual relationship has not been investigated in the literature. This paper proposes a new learning framework for language understanding and generation on top of dual supervised learning, providing a way to exploit the duality. The preliminary experiments show that the proposed approach boosts the performance for both tasks.

研究动机与目标

  • 研究自然语言理解(NLU)与自然语言生成(NLG)之间的双重关系,二者为互逆任务:NLU将话语映射到语义,NLG将语义映射到话语。
  • 开发一种新颖的训练框架,通过将这种对偶性整合到学习目标中作为正则化约束。
  • 通过使用带有对偶性约束的多目标公式联合优化模型,提升NLU和NLG任务的模型性能。
  • 设计有效的方法来估计边缘数据分布——具体而言,使用掩码自编码器估计语义框架,使用语言建模估计话语——这对于强制执行对偶性至关重要。
  • 通过实证验证,利用对偶性可增强NLU和NLG的泛化能力和鲁棒性,尤其是在建模语义表示中的复杂依赖关系时。

提出的方法

  • 该框架将多目标优化问题形式化,使NLU和NLG模型同时训练,并通过约束强制执行概率对偶性:P(x)P(y|x) = P(y)P(x|y)。
  • 应用拉格朗日松弛法将对偶性约束整合到损失函数中,引入正则化项 l_duality = (log P̂(x) + log P(y|x; θ_x→y) - log P̂(y) - log P(x|y; θ_y→x))²。
  • 使用10种不同的随机掩码和顺序,通过掩码自编码器估计语义框架的边缘分布 P̂(x),以建模槽值对之间的复杂依赖关系。
  • 通过在自然语言序列上进行标准语言建模,估计话语的边缘分布 P̂(y)。
  • 模型架构采用双向GRU,配备两层全连接层,NLU与NLG之间对称共享结构,支持共享表示学习。
  • 训练采用小批量Adam优化,每批64个样本,共10个训练周期,隐藏状态维度为200,可学习的词嵌入维度为50。

实验结果

研究问题

  • RQ1在NLU和NLG之间强制执行概率对偶性是否能同时提升两个任务的性能?
  • RQ2边缘分布估计方法的选择如何影响双学习在NLU和NLG中的有效性?
  • RQ3与独立训练相比,带有对偶性正则化的联合训练是否能带来更好的泛化性能?
  • RQ4使用掩码自编码器建模语义框架中的槽间依赖关系,与假设独立性相比,其影响如何?
  • RQ5不同的拉格朗日乘子值如何影响双学习目标中的权衡与性能?

主要发现

  • 所提出的双监督学习框架在所有NLU和NLG的评估指标上均优于独立训练(基线),证明了利用对偶性的有效性。
  • 在更强正则化(拉格朗日参数较低)的情况下,模型的F1(0.812)和BLEU(18.7)得分更高,表明更强的对偶性强制可提升性能。
  • 消融研究显示,通过掩码自编码器建模语义框架中的依赖关系,效果优于假设独立性,F1从0.812降至0.789。
  • 该方法通过实现更准确的槽值预测提升了NLU性能,通过生成更丰富且流畅的话语提升了NLG性能,优于基线。
  • 使用基于集成的掩码自编码器估计语义框架分布,显著提升了性能,证实了建模复杂依赖关系的重要性。
  • 联合训练方案带来了更好的泛化性能,表现为在ROUGE-L和F1等多个指标上的一致性提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。