[论文解读] MultiWOZ 2.3: A multi-domain task-oriented dialogue dataset enhanced with annotation corrections and co-reference annotation
本文介绍了 MultiWOZ 2.3,这是一个经过优化的多领域任务导向对话数据集,其对话行为和对话状态注释已更正,并通过共指消解得到增强。通过统一不一致的注释并整合共指特征,该数据集在对话状态追踪任务中实现了显著的性能提升,使用 SUMBT 时联合目标准确率达到 54.6%,使用 TRADE 时达到 49.9%,相比之前版本有显著改进。
Task-oriented dialogue systems have made unprecedented progress with multiple state-of-the-art (SOTA) models underpinned by a number of publicly available MultiWOZ datasets. Dialogue state annotations are error-prone, leading to sub-optimal performance. Various efforts have been put in rectifying the annotation errors presented in the original MultiWOZ dataset. In this paper, we introduce MultiWOZ 2.3, in which we differentiate incorrect annotations in dialogue acts from dialogue states, identifying a lack of co-reference when publishing the updated dataset. To ensure consistency between dialogue acts and dialogue states, we implement co-reference features and unify annotations of dialogue acts and dialogue states. We update the state of the art performance of natural language understanding and dialogue state tracking on MultiWOZ 2.3, where the results show significant improvements than on previous versions of MultiWOZ datasets (2.0-2.2).
研究动机与目标
- 解决 MultiWOZ 数据集中对话行为与对话状态之间长期存在的注释不一致问题。
- 通过修正对话行为和状态注释中的错误,提升对话状态追踪(DST)的质量。
- 引入共指注释,以解决人类话语中的代词和省略结构,增强话语层面的理解能力。
- 通过统一对话行为与状态注释,建立更可靠的面向任务对话系统的基准。
- 证明数据质量的提升可带来下游自然语言理解(NLU)和 DST 性能的可测量提升。
提出的方法
- 对 MultiWOZ 2.1 和 2.2 中存在错误的对话行为与对话状态注释进行差异化识别与更正,重点关注不一致之处。
- 应用基于规则的预处理流程,修复对话行为中错位的槽值和错误的跨度。
- 通过将代词和省略指代物标注为其先行词,实现共指消解的集成。
- 统一对话行为与对话状态注释,确保两层注释之间的一致性。
- 通过增加具备共指感知能力的注释扩展数据集,以支持对话系统中的话语级建模。
- 在更新后的数据集上重新评估最先进模型(SUMBT 和 TRADE),以验证性能提升。
实验结果
研究问题
- RQ1对话行为与对话状态之间的注释不一致性在多大程度上影响对话状态追踪的性能?
- RQ2共指消解在多领域对话中能在多大程度上提升对话状态追踪的准确性?
- RQ3经过更正与统一注释的优化数据集是否能带来 NLU 和 DST 基准的可测量性能提升?
- RQ4共指感知注释对面向任务对话系统中联合目标准确率有何影响?
- RQ5MultiWOZ 2.3 与之前版本(2.0–2.2)相比,在模型泛化能力和鲁棒性方面表现如何?
主要发现
- 使用 SUMBT 模型时,MultiWOZ 2.3 的联合目标准确率达到 52.9%,显著高于 MultiWOZ 2.2 的 49.7%。
- 引入共指注释后,SUMBT 模型的联合目标准确率达到 54.6%,证明了话语级建模的优势。
- TRADE 模型在共指增强数据集上的联合目标准确率达到 49.9%,高于 MultiWOZ 2.2 的 46.6%。
- 在 MultiWOZ 2.3 上训练的基于 BERT 的 NLU 模型,其 F1 分数和话语准确率相比之前版本均提升了 5%。
- 在 DST 任务中,该数据集在 30 个槽中的 17 个上达到最佳性能;加入共指特征后,30 个槽中有 24 个达到最佳性能,表明整体性能广泛提升。
- 与早期版本相比,MultiWOZ 2.3 中的 'dontcare' 槽分类门控 F1 分数提高了超过 9%,证实了注释质量的显著提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。