Skip to main content
QUICK REVIEW

[论文解读] The SPPD System for Schema Guided Dialogue State Tracking Challenge

Miao Li, Haoqi Xiong|arXiv (Cornell University)|Jun 16, 2020
Speech and dialogue systems参考文献 22被引用 9
一句话总结

本论文提出SPPD系统,一种针对DSTC8中Schema Guided Dialogue(SGD)数据集的零样本对话状态追踪模型,利用基于BERT的编码器捕捉模式描述与对话话语之间的语义关系。通过整合值检索、槽位延续机制以及概率集成策略,该系统在未见领域和业务上的零样本泛化能力方面表现卓越,达到最先进性能。

ABSTRACT

This paper introduces one of our group's work on the Dialog System Technology Challenges 8 (DSTC8), the SPPD system for Schema Guided dialogue state tracking challenge. This challenge, named as Track 4 in DSTC8, provides a brand new and challenging dataset for developing scalable multi-domain dialogue state tracking algorithms for real world dialogue systems. We propose a zero-shot dialogue state tracking system for this task. The key components of the system is a number of BERT based zero-shot NLU models that can effectively capture semantic relations between natural language descriptions of services' schemas and utterances from dialogue turns. We also propose some strategies to make the system better to exploit information from longer dialogue history and to overcome the slot carryover problem for multi-domain dialogues. The experimental results show that the proposed system achieves a significant improvement compared with the baseline system.

研究动机与目标

  • 解决多领域、多业务对话系统中评估集中存在未见领域和业务时的零样本对话状态追踪挑战。
  • 克服现有模型依赖已见本体或需为新领域微调的局限性。
  • 提升在长对话历史及跨领域情境下对槽位值的追踪能力,尤其针对非类别型槽位。
  • 通过动态注意力与Dropout策略增强模型对前序轮次误差传播的鲁棒性。
  • 通过利用模式描述与对话话语之间的语义相似性,实现对未见业务的强泛化性能。

提出的方法

  • 使用基于BERT的神经网络联合编码模式描述(意图、槽位、值)与对话话语,实现对槽位-值关系的端到端语义理解。
  • 在训练过程中应用先前意图Dropout策略(Dropout率0.9),以减少对前序轮次的过度依赖,提升对误差传播的鲁棒性。
  • 实施值检索(VR)策略,从先前系统话语中提取槽位值,将上下文扩展至当前轮次之外。
  • 引入槽位延续(SCO)机制,在多领域对话中实现槽位值在领域间的传播,提升共享信息的追踪能力。
  • 应用概率组合(ProbAvg)策略,对多个基于BERT的模型(如BERT-Base、BERT-Large、RoBERTa-Large)的预测结果进行集成,提升置信度与准确性。
  • 使用集成模型,对多个微调后的模型输出进行平均,进一步提升联合目标准确率与平均目标准确率。

实验结果

研究问题

  • RQ1基于BERT的模型是否能在不针对这些领域进行微调的情况下,有效泛化至未见领域和业务的对话状态追踪?
  • RQ2对话状态追踪器如何利用更长对话历史中的信息,包括系统话语与跨领域槽位延续?
  • RQ3哪些策略可有效缓解多轮对话状态追踪中来自前序轮次的误差传播?
  • RQ4在零样本与少样本评估设置下,多个基于BERT的模型的概率组合策略能在多大程度上提升性能?
  • RQ5通过注意力机制引入模式描述语义,如何提升多领域对话系统在零样本泛化中的表现?

主要发现

  • 所提系统在测试集上实现90.0%(91.6/87.8)的联合目标准确率,显著优于基线模型,展现出强大的零样本泛化能力。
  • 系统实现98.8%的意图准确率(98.9/98.6),相较于基线有显著提升,尤其在处理未见业务方面表现突出。
  • 训练过程中采用0.9的先前意图Dropout率时,意图准确率达到最高,表明降低对前序轮次的依赖可提升模型鲁棒性。
  • 值检索(VR)与槽位延续(SCO)策略显著提升了对非类别型槽位的性能,这些槽位常被仅依赖当前话语的模型所遗漏。
  • 概率组合策略(ProbAvg)与集成模型(ensemble + all strategies)取得最佳整体结果,测试集上联合目标准确率为90.0%,联合F1为99.5%。
  • 与基线相比,本系统在已见与未见业务之间的性能差距显著缩小(如联合目标准确率分别为88.1%与85.6%),证实其具备强大的零样本泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。