[论文解读] Beyond Domain APIs: Task-oriented Conversational Modeling with Unstructured Knowledge Access Track in DSTC9
本文介绍了在DSTC9上设立的一个挑战赛道,该赛道将任务导向型对话系统的能力从固定领域API扩展至非结构化知识源(如FAQ和网页内容)。该方法通过神经模型微调增强的MultiWOZ和旧金山旅游数据,提出了三个核心任务:知识需求轮次检测、知识选择以及知识增强型响应生成。采用集成大型预训练语言模型的方法,在性能上达到最先进水平,并展现出对未见领域和知识源的强大泛化能力。
Most prior work on task-oriented dialogue systems are restricted to a limited coverage of domain APIs, while users oftentimes have domain related requests that are not covered by the APIs. This challenge track aims to expand the coverage of task-oriented dialogue systems by incorporating external unstructured knowledge sources. We define three tasks: knowledge-seeking turn detection, knowledge selection, and knowledge-grounded response generation. We introduce the data sets and the neural baseline models for three tasks. The challenge track received a total of 105 entries from 24 participating teams. In the evaluation results, the ensemble methods with different large-scale pretrained language models achieved high performances with improved knowledge selection capability and better generalization into unseen data.
研究动机与目标
- 解决任务导向型对话系统无法处理超出预定义API或数据库范围的用户查询的局限性。
- 使对话系统能够访问并利用FAQ、网页内容和客户评价等非结构化外部知识源,以提供更全面的响应。
- 开发一个端到端框架,能够检测用户查询是否需要外部知识,选择相关知识片段,并生成上下文恰当、基于知识的响应。
- 评估模型在未见领域、本地化场景和知识源上的泛化能力,以模拟真实世界部署场景。
- 通过新数据集和评估协议,建立知识增强型任务导向对话的基准。
提出的方法
- 提出三阶段流水线:(1) 知识需求轮次检测(二分类任务,判断是否需要外部知识),(2) 知识选择(对候选片段与当前话语的相关性进行排序),(3) 知识增强型响应生成(生成自然、上下文连贯且基于选定知识的响应)。
- 以对话上下文窗口 $U_t = ext{utterances}_{t-w+1}^t$ 和一组知识片段 $K = ext{snippets}_1^n$ 作为系统输入。
- 为每个任务采用神经模型:轮次检测使用二分类模型,知识选择使用二元相关性评分模型,响应生成使用序列生成模型。
- 提出增强版MultiWOZ 2.1,新增22,834对来自FAQ网页的知识需求话语对,并构建了一个独立的旧金山旅游对话测试集,涵盖未见领域和知识源。
- 采用集成方法,结合多个大规模预训练语言模型(如BERT、RoBERTa、T5)以提升所有三个任务的性能。
- 使用自动指标(BLEU、F1、Recall@1)和人工评估(准确性与恰当性)进行模型评估,并进行显著性检验。
实验结果
研究问题
- RQ1任务导向型对话系统能否有效检测用户查询是否需要超出现有API或数据库的外部知识?
- RQ2模型在面对大量非结构化文本时,能否从候选片段中准确选择最相关的内容?
- RQ3知识增强型响应生成在使用选定知识时,能在多大程度上生成流畅、准确且上下文恰当的响应?
- RQ4使用大规模预训练语言模型的集成方法,如何提升知识增强型对话系统的性能与泛化能力?
- RQ5知识选择性能对整体端到端对话质量的影响如何,尤其是在未见领域和知识源中?
主要发现
- 结合多个大规模预训练语言模型的集成方法在所有三个任务中均取得最高分,优于单一模型。
- 知识选择任务与人工评估排名的相关性最强(Spearman相关系数 ρ = 0.8601),表明其是端到端性能最关键的组件。
- 团队19在准确性和恰当性的人工评估中得分最高,主要得益于其卓越的知识选择性能。
- 表现最佳的系统在未见数据(如旧金山旅游领域)上的泛化能力显著优于基线模型,其人工评估得分甚至高于域内测试集。
- 人工成对评估显示,尽管团队19与团队3在恰当性得分上相近,但团队19的响应更准确。
- 基线模型在未见数据上表现出显著性能下降,凸显了在真实世界部署中泛化能力的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。