[论文解读] A Hybrid Task-Oriented Dialog System with Domain and Task Adaptive Pretraining
本文提出了一种混合端到端任务导向对话系统,通过领域和任务自适应预训练微调 GPT-2 以应对多领域对话任务。通过在对话特定数据集上进行预训练,并通过多任务微调联合优化自然语言理解(NLU)、对话状态追踪(DST)和自然语言生成(NLG),该系统实现了最先进性能,在 DSTC9 共享任务中以 91% 的人类评估平均成功率并列第一。
This paper describes our submission for the End-to-end Multi-domain Task Completion Dialog shared task at the 9th Dialog System Technology Challenge (DSTC-9). Participants in the shared task build an end-to-end task completion dialog system which is evaluated by human evaluation and a user simulator based automatic evaluation. Different from traditional pipelined approaches where modules are optimized individually and suffer from cascading failure, we propose an end-to-end dialog system that 1) uses Generative Pretraining 2 (GPT-2) as the backbone to jointly solve Natural Language Understanding, Dialog State Tracking, and Natural Language Generation tasks, 2) adopts Domain and Task Adaptive Pretraining to tailor GPT-2 to the dialog domain before finetuning, 3) utilizes heuristic pre/post-processing rules that greatly simplify the prediction tasks and improve generalizability, and 4) equips a fault tolerance module to correct errors and inappropriate responses. Our proposed method significantly outperforms baselines and ties for first place in the official evaluation. We make our source code publicly available.
研究动机与目标
- 解决基于流水线的任务导向对话系统在多领域、多目标场景下的局限性,包括错误传播和高工程成本。
- 通过将预训练适配到对话特定分布,弥合通用语言模型(如 GPT-2)与任务导向对话之间的领域差距。
- 通过在单一自回归序列模型中联合学习自然语言理解、对话状态追踪和响应生成,提升端到端对话系统的性能。
- 通过启发式预/后处理和容错模块增强鲁棒性和人类自然度,以纠正模型错误。
- 通过领域自适应预训练与多任务微调相结合,在 DSTC9 端到端多领域任务完成挑战中实现顶尖性能。
提出的方法
- 通过在外部对话数据集(如 Schema-Guided Dialog 和 Taskmaster)上进行领域自适应预训练(DAPT),在微调前使 GPT-2 与对话特定的语言模式对齐。
- 通过任务自适应预训练(TAPT)进一步将模型微调至任务导向对话,尽管本研究中未观察到其提升效果。
- 在 MultiWoz 2.1 数据集上实施多任务微调,采用单一序列到序列目标,联合优化信念状态生成、响应生成和负样本判别。
- 使用扁平化输入格式,将对话历史、信念状态、数据库结果和响应拼接为单个自回归序列,以实现联合建模。
- 集成启发式预处理,将代理话语去体现代理化并归一化为模板,并通过后处理优化模型输出以提升一致性和可读性。
- 部署容错模块,检测并纠正模型错误(如不一致的实体引用或幻觉信息),从而提升响应可靠性。
实验结果
研究问题
- RQ1领域自适应预训练是否能显著提升预训练语言模型在任务导向对话设置下的性能?
- RQ2在多领域对话基准上微调时,任务自适应预训练是否能进一步提升模型性能?
- RQ3在端到端对话系统中,联合优化 NLU、DST 和 NLG 的多任务微调是否有效?
- RQ4启发式预/后处理规则在多大程度上提升了模型输出的泛化能力和人类自然度?
- RQ5容错机制是否能有效纠正模型生成的错误,并提升人类评估中的成功率?
主要发现
- 所提系统在人类评估中实现了 91% 的平均成功率,在 DSTC9 共享任务中并列第一。
- 仅使用领域自适应预训练(DAPT)即在自动评估中使成功率提升 3%,表明领域特定适配具有显著收益。
- 任务自适应预训练(TAPT)未提升性能,甚至轻微降低结果,表明当 DAPT 已应用时,TAPT 可能无益处。
- DAPT 与 TAPT 的结合性能与 DAPT 单独使用相近,表明在本设置中 DAPT 是主导且最有效的适应策略。
- 使用启发式预/后处理和容错模块显著提升了响应质量与一致性,对高人类评估得分有重要贡献。
- 在自动评估中,该系统优于强基线模型,在成功率和预订率上均排名第二,且在所有指标上表现强劲。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。