Skip to main content
QUICK REVIEW

[论文解读] Dynamic Fusion Network for Multi-Domain End-to-end Task-Oriented Dialog

Libo Qin, Xu Xiao|arXiv (Cornell University)|Apr 23, 2020
Speech and dialogue systems参考文献 18被引用 8
一句话总结

本文提出了一种用于多领域端到端任务导向对话的动态融合网络(DF-Net),通过共享-私有架构并引入动态融合机制,显式建模共享与私有领域知识。该方法通过可学习门控机制自动学习领域间的相关性,在低资源领域上显著提升性能,在有限训练数据下相比之前最先进模型平均提升13.9%。

ABSTRACT

Recent studies have shown remarkable success in end-to-end task-oriented dialog system. However, most neural models rely on large training data, which are only available for a certain number of task domains, such as navigation and scheduling. This makes it difficult to scalable for a new domain with limited labeled data. However, there has been relatively little research on how to effectively use data from all domains to improve the performance of each domain and also unseen domains. To this end, we investigate methods that can make explicit use of domain knowledge and introduce a shared-private network to learn shared and specific knowledge. In addition, we propose a novel Dynamic Fusion Network (DF-Net) which automatically exploit the relevance between the target domain and each domain. Results show that our model outperforms existing methods on multi-domain dialogue, giving the state-of-the-art in the literature. Besides, with little training data, we show its transferability by outperforming prior best model by 13.9\% on average.

研究动机与目标

  • 解决端到端任务导向对话系统中低资源领域适应的挑战。
  • 显式建模多个领域之间的共享与私有知识,以提升泛化能力。
  • 开发一种机制,动态捕捉领域间的细粒度相关性以实现知识迁移。
  • 利用相关源领域的知识,提升在未见或低资源领域上的模型性能。
  • 在有限训练数据下,超越现有方法在多领域对话基准上的表现。

提出的方法

  • 模型采用共享-私有网络架构,分别学习领域共享与领域特定的特征。
  • 引入动态融合模块,通过门控机制计算注意力权重,自适应地为每个目标领域选择相关源领域的特征。
  • 动态融合机制被应用于编码器、解码器以及记忆模块以实现KB特征检索。
  • 采用对抗性训练,促使共享模块生成真正共享的领域表示。
  • 该方法借鉴混合专家(MoE)机制,结合领域特定知识,同时实现动态、基于相关性的融合。
  • 模型在多领域对话数据集上进行端到端训练,联合优化响应生成与知识对齐。

实验结果

研究问题

  • RQ1在多领域端到端任务导向对话中,如何有效建模共享与私有知识?
  • RQ2动态融合机制能否提升从高资源领域到低资源领域的知识迁移效果?
  • RQ3领域间相关性在低数据场景下如何影响模型性能?
  • RQ4模型能否在极少标注数据下泛化到未见领域?
  • RQ5细粒度领域相关性建模对响应质量与准确率有何影响?

主要发现

  • 所提出的DF-Net在SMD与MultiWOZ 2.1基准上均达到最先进性能。
  • 在导航领域仅使用5%的训练数据时,模型平均性能相比之前最佳模型提升13.9%。
  • 专家门控机制为更相关领域(如调度领域相对于天气领域)分配更高权重,用于导航任务。
  • 案例研究证实,模型能成功实现语义相似领域(如导航与调度中的'location'和'set')之间的知识迁移。
  • 人工评估显示,模型在正确性、流畅性与自然度方面优于GLMP,平均得分超过5分制的4.0分。
  • 通过细粒度领域相关性建模,模型在新领域上展现出强大的零样本与少样本适应能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。