[论文解读] From Machine Reading Comprehension to Dialogue State Tracking: Bridging the Gap
本文通过将对话状态追踪(DST)重新表述为机器阅读理解(MRC)任务,提出了一种新颖的方法,通过区分分类型槽和抽取型槽,以利用多项选择和跨度抽取型MRC模型。该方法在全量数据设置下达到了最先进性能,并在少样本和零样本场景中显著优于先前方法,在30个槽中对其中12个槽的平均槽精度超过90%,且无需任何领域内训练数据。
Dialogue state tracking (DST) is at the heart of task-oriented dialogue systems. However, the scarcity of labeled data is an obstacle to building accurate and robust state tracking systems that work across a variety of domains. Existing approaches generally require some dialogue data with state information and their ability to generalize to unknown domains is limited. In this paper, we propose using machine reading comprehension (RC) in state tracking from two perspectives: model architectures and datasets. We divide the slot types in dialogue state into categorical or extractive to borrow the advantages from both multiple-choice and span-based reading comprehension models. Our method achieves near the current state-of-the-art in joint goal accuracy on MultiWOZ 2.1 given full training data. More importantly, by leveraging machine reading comprehension datasets, our method outperforms the existing approaches by many a large margin in few-shot scenarios when the availability of in-domain data is limited. Lastly, even without any state tracking data, i.e., zero-shot scenario, our proposed approach achieves greater than 90% average slot accuracy in 12 out of 30 slots in MultiWOZ 2.1.
研究动机与目标
- 为解决在多样化领域中对话状态追踪(DST)标注数据稀缺的问题。
- 提升DST模型在未见领域中的泛化能力,尤其是在有限或无领域内训练数据的情况下。
- 利用现有丰富的机器阅读理解(MRC)数据集和模型,以提升DST性能。
- 开发一种统一框架,通过将槽分为分类型和抽取型,将DST视为MRC任务。
- 在全量数据、少样本和零样本设置下,验证基于MRC的DST方法的有效性。
提出的方法
- 通过基于槽名称和类型的生成问题,将对话状态追踪表述为机器阅读理解(MRC)任务。
- 将槽分类为两类:分类型(如parking: Yes/No/Don’t Care)和抽取型(如hotel-name),以匹配相应的MRC范式。
- 对分类型槽使用多项选择MRC模型,其中答案从固定选项集中选择。
- 对抽取型槽使用跨度基于MRC模型,其中答案是对话上下文中的一个文本跨度。
- 实施两阶段训练策略:首先在大规模MRC数据集(如SQuAD、Natural Questions)上预训练,然后在目标DST数据集(如MultiWOZ 2.1)上微调。
- 应用归一化处理,将预测的跨度映射到标准化的槽值,以提高鲁棒性和可解释性。
实验结果
研究问题
- RQ1机器阅读理解技术能否有效适配到对话状态追踪中,以减少对领域内标注数据的依赖?
- RQ2在少样本和零样本设置下,基于MRC的DST性能与现有方法相比如何?
- RQ3统一的基于MRC的框架是否能在不进行领域内数据微调的情况下,泛化到多样化槽类型和领域?
- RQ4当无领域内训练数据时,预训练的MRC模型在多大程度上能将知识迁移至DST?
- RQ5对分类型与抽取型槽类型的区分是否能提升基于MRC的DST的有效性?
主要发现
- 在全量数据设置下,所提方法在MultiWOZ 2.1上实现了接近最先进水平的联合目标准确率,表明在完整训练数据下具备强大性能。
- 在少样本设置下,仅使用1%的酒店领域训练数据(约20–30条对话),模型实现了45.91%的联合目标准确率,显著优于此前最佳的19.73%。
- 在零样本设置下,不使用任何领域内训练数据,模型在MultiWOZ 2.1中30个槽中的12个槽上实现了平均槽精度超过90%。
- 跨度基于MRC模型成功识别出包含真实槽值的对话相关跨度,这些跨度经归一化处理后生成了准确的状态预测。
- 零样本性能在多样化槽类型上表现稳健,包括在先前基于迁移的方法(如TRADE)中表现失败的领域外槽(如hotel.name),表明本方法具有更强的泛化能力。
- 该方法展现出强大的泛化能力,在零样本评估中,大多数槽的平均准确率均达到至少50%,表明从MRC数据中有效迁移了知识。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。