Skip to main content
QUICK REVIEW

[论文解读] Adding Chit-Chat to Enhance Task-Oriented Dialogues

Kai Sun, Seungwhan Moon|arXiv (Cornell University)|Oct 24, 2020
AI in Service Interactions被引用 10
一句话总结

本文提出 Accentor 框架,通过采用人类与 AI 协作的数据收集方法,将上下文相关的闲聊回复整合到任务导向对话中,从而提升对话质量。该方法利用预训练模型生成多样化的闲聊候选回复,通过自定义微调分类器过滤低质量回复,并结合人类标注与理由说明,最终从 SGD 和 MultiWOZ 2.1 数据集中获得 23.8K 条增强对话。人工评估显示,在参与度、趣味性、知识性与自然度方面均有显著提升,同时保持了具有竞争力的任务性能。

ABSTRACT

Existing dialogue corpora and models are typically designed under two disjoint motives: while task-oriented systems focus on achieving functional goals (e.g., booking hotels), open-domain chatbots aim at making socially engaging conversations. In this work, we propose to integrate both types of systems by Adding Chit-Chat to ENhance Task-ORiented dialogues (ACCENTOR), with the goal of making virtual assistant conversations more engaging and interactive. Specifically, we propose a Human AI collaborative data collection approach for generating diverse chit-chat responses to augment task-oriented dialogues with minimal annotation effort. We then present our new chit-chat-based annotations to 23.8K dialogues from two popular task-oriented datasets (Schema-Guided Dialogue and MultiWOZ 2.1) and demonstrate their advantage over the originals via human evaluation. Lastly, we propose three new models for adding chit-chat to task-oriented dialogues, explicitly trained to predict user goals and to generate contextually relevant chit-chat responses. Automatic and human evaluations show that, compared with the state-of-the-art task-oriented baseline, our models can code-switch between task and chit-chat to be more engaging, interesting, knowledgeable, and humanlike, while maintaining competitive task performance.

研究动机与目标

  • 通过整合闲聊内容,弥合任务导向对话系统与开放域聊天机器人之间的差距,以提升对话的参与度。
  • 通过人类与 AI 协作的流水线,最小化创建高质量任务导向对话闲聊回复的人工标注工作量。
  • 开发新型模型,使其能够在任务导向目标与自然闲聊之间实现动态切换,从而实现更自然、更具参与度的交互。
  • 构建一个全新的公开数据集,包含来自 SGD 和 MultiWOZ 2.1 的 23.8K 条对话的闲聊标注。

提出的方法

  • 两阶段候选回复生成流程:首先利用预训练生成模型生成多样化的闲聊回复,然后通过自定义微调分类器过滤低质量候选。
  • 采用人机协同标注方式,对过滤后的候选回复进行‘优质’或‘劣质’的判断,并附上理由,以确保其上下文相关性与质量。
  • 基于增强数据集训练三种神经模型——端到端模型与两种代码切换架构模型,采用联合监督策略,同时优化用户目标追踪与闲聊回复生成。
  • 使用 ACUTE-Eval 进行自动评估,并通过人工评估在四个维度上的表现:参与度、趣味性、知识性与自然度。
  • 采用统一的训练目标,使模型能够在单轮对话中动态切换任务导向回复与闲聊回复。
  • 在增强数据集上微调预训练语言模型,以同时提升任务性能与对话质量。

实验结果

研究问题

  • RQ1能否通过极少的人工标注,高效且有效地为任务导向对话生成闲聊回复?
  • RQ2在参与度、知识性与自然度方面,添加上下文相关的闲聊是否能显著提升人类对对话质量的感知?
  • RQ3模型是否能够实现任务导向与闲聊回复之间的动态代码切换,同时不降低功能性表现?
  • RQ4与完全人工标注或纯自动方法相比,所提出的 AI 与人类协作数据收集流程在成本与质量方面表现如何?

主要发现

  • 人工评估显示,与原始对话相比,加入闲聊的对话在参与度、趣味性、知识性与自然度四个维度上均显著更受青睐。
  • 所提出的模型在人工评估指标上优于当前最先进基线模型,同时保持了具有竞争力的目标追踪准确率与动作决策 F1 分数。
  • 人类与 AI 协作的数据收集方法通过在人工标注前过滤低质量候选,显著降低了标注工作量,提升了效率。
  • 新数据集 accentor-SGD 与 accentor-MultiWOZ 2.1 包含 23.8K 条对话,其闲聊回复具有上下文相关性,是首个明确标注任务与闲聊组件的公开数据集。
  • 代码切换模型展现出生成与对话上下文及用户目标相关之闲聊回复的能力。
  • 使用 ACUTE-Eval 的自动评估结果证实,增强后的对话更具参与度与自然度,所有评估维度均呈现统计显著提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。