Skip to main content
QUICK REVIEW

[论文解读] Multi-Task Learning for Situated Multi-Domain End-to-End Dialogue Systems

Po-Nien Kung, Chung‐Cheng Chang|arXiv (Cornell University)|Oct 11, 2021
Topic Modeling参考文献 19被引用 5
一句话总结

本文提出一种基于单个 GPT-2 模型的多任务学习框架,用于在情境化、多领域、端到端对话系统中联合执行信念状态追踪、响应生成和动作预测。通过引入输入修改方法,如动作定位和掩码历史损失,该模型在家具和时尚两个领域均实现了最先进性能,且采用单一统一架构。

ABSTRACT

Task-oriented dialogue systems have been a promising area in the NLP field. Previous work showed the effectiveness of using a single GPT-2 based model to predict belief states and responses via causal language modeling. In this paper, we leverage multi-task learning techniques to train a GPT-2 based model on a more challenging dataset with multiple domains, multiple modalities, and more diversity in output formats. Using only a single model, our method achieves better performance on all sub-tasks, across domains, compared to task and domain-specific models. Furthermore, we evaluated several proposed strategies for GPT-2 based dialogue systems with comprehensive ablation studies, showing that all techniques can further improve the performance.

研究动机与目标

  • 为解决模块化、任务特定对话系统的局限性,将信念状态追踪、响应生成和动作预测统一为单一端到端模型。
  • 通过多任务学习中的知识迁移,提升多领域、多模态对话系统的性能。
  • 探索有效的输入修改方法和训练策略,以增强统一文本到文本框架下生成和分类任务的性能。
  • 证明单一 GPT-2 模型可在多样化对话子任务中超越任务和领域特定模型。
  • 验证迭代预测与输入工程相结合的多任务训练在复杂、真实世界对话场景中的有效性。

提出的方法

  • 该模型使用共享的 GPT-2 编码器处理对话历史和多模态输入,包括用户话语、视觉对象和动作信息。
  • 采用序列化多任务训练目标,模型按顺序预测信念状态、响应和动作,使用任务特定前缀和自回归生成。
  • 关键输入修改包括基于动作标记定位响应,以及将信念状态拆分为意图和槽位组件以提升消歧能力。
  • 模型应用掩码历史损失(MHL),在训练期间对过去对话轮次进行掩码,以改善上下文建模和泛化能力。
  • 使用片段嵌入以区分不同对话轮次,尽管消融实验表明其对性能影响极小。
  • 通过在时尚和家具数据集上联合微调,该框架支持多领域训练,从而提升低资源领域的性能。

实验结果

研究问题

  • RQ1单一 GPT-2 模型能否在多领域、多模态设置下,同时有效处理多个对话子任务——信念状态追踪、响应生成和动作预测?
  • RQ2添加动作标记和拆分信念状态等输入修改方法,在不同领域中对模型性能有何影响?
  • RQ3多领域训练在多大程度上提升性能,特别是在低资源领域(如时尚)中?
  • RQ4掩码历史损失是否能提升端到端对话系统中生成和分类任务的性能?
  • RQ5文本到文本生成能否有效应用于复杂、多标签动作和属性预测任务,并实现具有竞争力的准确率?

主要发现

  • 包含所有提议特性的完整模型在所有子任务和领域中均取得最佳性能,优于基线模型和任务特定架构。
  • 在输入中加入动作信息显著提升了响应生成和信念状态追踪性能,尤其在时尚领域表现明显,移除后性能显著下降。
  • 多领域训练提升了低资源时尚领域的性能,并在两个领域中均改善了 API 和信念状态预测性能。
  • 掩码历史损失在生成任务中持续提升性能,并对分类任务带来益处,尤其在时尚数据集上表现突出。
  • 该模型在时尚属性预测任务上达到惊人的 79% 准确率,证明了文本到文本生成在复杂多标签分类任务中的可行性。
  • 尽管使用较小模型(gpt2-small)且仅依赖两轮对话历史,模型仍取得强劲性能,表明其具备在更大模型和更长上下文下扩展的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。