Skip to main content
QUICK REVIEW

[论文解读] Action-Based Conversations Dataset: A Corpus for Building More In-Depth Task-Oriented Dialogue Systems

Derek Chen, Howard Chen|arXiv (Cornell University)|Apr 1, 2021
Topic Modeling参考文献 36被引用 6
一句话总结

本文提出了动作导向对话数据集(ABCD),这是一个大规模、全标注的对话语料库,包含10,042段人类之间的对话,涉及55种用户意图,需在策略约束下执行多步动作。该研究提出了两个新任务——动作状态追踪(Action State Tracking)与级联对话成功(Cascading Dialogue Success),并基于预训练语言模型建立了基线,结果显示在对话成功任务上,最先进模型(31.9%)与人类表现(82.7%)之间存在50.8%的准确率差距。

ABSTRACT

Existing goal-oriented dialogue datasets focus mainly on identifying slots and values. However, customer support interactions in reality often involve agents following multi-step procedures derived from explicitly-defined company policies as well. To study customer service dialogue systems in more realistic settings, we introduce the Action-Based Conversations Dataset (ABCD), a fully-labeled dataset with over 10K human-to-human dialogues containing 55 distinct user intents requiring unique sequences of actions constrained by policies to achieve task success. We propose two additional dialog tasks, Action State Tracking and Cascading Dialogue Success, and establish a series of baselines involving large-scale, pre-trained language models on this dataset. Empirical results demonstrate that while more sophisticated networks outperform simpler models, a considerable gap (50.8% absolute accuracy) still exists to reach human-level performance on ABCD.

研究动机与目标

  • 为解决缺乏反映真实客户服务工作流程的、真实且受策略约束的任务导向对话数据集的问题。
  • 建模能够平衡用户请求与组织策略的对话系统,要求执行顺序性、程序性的动作。
  • 开发一种可扩展的方法,用于收集训练有素的代理与未经训练的用户之间自然的对话,体现角色不对称性。
  • 提出并评估两个新评估任务:动作状态追踪(Action State Tracking)与级联对话成功(Cascading Dialogue Success)。
  • 基于预训练语言模型建立强基线,并识别出提升性能的关键约束条件(例如,动作历史、指南信息)

提出的方法

  • 开发了专家实时聊天系统(Expert Live Chat),用于收集训练有素的代理与未经训练的用户之间的真实对话,确保角色不对称性。
  • 对10,042段对话进行了标注,包含55种不同的用户意图、55种独特的动作序列,以及明确的代理指南,用以定义策略约束。
  • 提出了动作状态追踪(AST),即在给定对话历史和指南的前提下,推断正确动作状态,扩展了传统的对话状态追踪方法。
  • 引入了级联对话成功(CDS)作为多轮任务,要求代理在每一轮中根据历史记录和策略条件,选择正确的动作或回应。
  • 在AST和CDS任务上,对多种预训练语言模型(BERT、RoBERTa、AlBERT)进行训练与评估,并通过消融研究分析输入组件(如意图、指南、动作历史)的影响。
  • 使用oracle消融实验,隔离意图分类、指南知识和动作上下文对模型性能的影响。

实验结果

研究问题

  • RQ1当受到公司策略和用户请求约束时,预训练语言模型能否有效追踪动作状态?
  • RQ2在策略约束型对话系统中,基于代理指南和对话历史进行条件化处理,如何影响模型性能?
  • RQ3在复杂、多步的任务导向对话中,最先进模型与人类水平表现之间的性能差距有多大?
  • RQ4在级联对话任务中,不同输入组件(如意图、指南、动作历史)如何共同影响任务成功?
  • RQ5在使用不完整策略知识时,主要的失败模式是什么?如何加以缓解?

主要发现

  • 表现最佳的模型(RoBERTa-large)在级联对话成功任务上的准确率为31.9%,远低于人类评估的82.7%。
  • 最先进模型与人类表现之间仍存在50.8%的绝对准确率差距,表明仍有巨大提升空间。
  • 若从上下文中移除动作历史,性能出现显著下降,证实了在策略约束对话中顺序建模的重要性。
  • 提供真实意图信息可将性能提升至32.3%,但加入不准确的指南知识反而使性能降至30.6%,原因是错误的动作掩码。
  • 最优配置(同时使用oracle意图与指南信息)达到32.7%的准确率,凸显了对鲁棒策略感知建模的迫切需求。
  • 同时基于对话历史和代理指南进行条件化处理显著提升了性能,表现最佳的模型均依赖于这两种上下文信息。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。