Skip to main content
QUICK REVIEW

[论文解读] A Knowledge-Grounded Dialog System Based on Pre-Trained Language Models

Weijie Zhang, Jiaoxuan Chen|arXiv (Cornell University)|Jun 28, 2021
Topic Modeling参考文献 17被引用 4
一句话总结

该论文提出了一种基于知识的对话系统,用于任务导向型对话,采用微调后的 T5 及其他预训练语言模型,结合基于 N-gram 和编辑距离的实体过滤方法,并引入指针网络进行响应生成。该系统在 DSTC9 Track 1 的自动评估中位列前十,在人类评估中也位列前十,相较于基线模型在所有子任务中均表现出更高的准确率与效率。

ABSTRACT

We present a knowledge-grounded dialog system developed for the ninth Dialog System Technology Challenge (DSTC9) Track 1 - Beyond Domain APIs: Task-oriented Conversational Modeling with Unstructured Knowledge Access. We leverage transfer learning with existing language models to accomplish the tasks in this challenge track. Specifically, we divided the task into four sub-tasks and fine-tuned several Transformer models on each of the sub-tasks. We made additional changes that yielded gains in both performance and efficiency, including the combination of the model with traditional entity-matching techniques, and the addition of a pointer network to the output layer of the language model.

研究动机与目标

  • 开发一种任务导向型对话系统,能够利用非结构化知识源(如常见问题集)回答查询,而不仅限于结构化数据库。
  • 通过使用预训练语言模型,提升知识检索轮次检测、知识选择和响应生成任务的性能与效率。
  • 通过将神经模型与传统文本匹配技术(N-gram 和编辑距离)结合,实现实体过滤,降低计算成本。
  • 通过与 T5 集成的指针网络,提升响应生成质量。
  • 在测试集中评估系统对未见领域和实体的泛化能力。

提出的方法

  • 在三个子任务上微调 T5、ELECTRA 及其他预训练语言模型:知识检索轮次检测、知识选择和响应生成。
  • 应用基于 N-gram 和编辑距离的过滤方法,在神经模型推理前减少候选实体数量,从而提升效率与召回率。
  • 在 T5 解码器之上集成指针网络,通过从输入知识中复制标记来提升响应生成质量。
  • 采用集成学习与阈值调优($t_{\text{ktd}} = 0.25$)以提升在未见数据上的鲁棒性与泛化能力。
  • 使用交叉熵损失进行训练,虽测试了焦点损失,但仅带来微小收益。
  • 采用与基线一致的流水线架构,但通过现代自然语言处理技术增强每个阶段。

实验结果

研究问题

  • RQ1像 T5 和 ELECTRA 这类预训练语言模型是否能在基于知识的对话任务中超越旧模型(如 BERT、GPT-2)?
  • RQ2将神经模型与传统文本匹配方法(N-gram、编辑距离)结合,在减少候选空间和提升检索准确率方面有多有效?
  • RQ3指针网络在基于知识的对话系统中能在多大程度上提升响应生成质量?
  • RQ4模型在未见领域和实体上的性能如何下降?集成方法或阈值调优能否缓解此问题?
  • RQ5不同的损失函数(交叉熵与焦点损失)对知识选择和响应生成有何影响?

主要发现

  • T5 模型在知识检索轮次检测的验证数据上 F1 分数超过 99%,表明在已见数据上表现强劲。
  • 使用 N-gram 和编辑距离进行实体过滤,在将候选数量大幅减少的同时,保留了超过 99.7% 的正确答案,显著提升了推理效率。
  • T5-pointer 模型在测试数据上取得了最高的 BLEU-4、METEOR 和 ROUGE-L 分数,ROUGE-L 排名第二,BLEU-4 排名第七(共 24 支队伍)。
  • 在知识选择任务中,T5 集成模型在 24 支队伍中排名第 9 位,优于 ELECTRA 和基于 BERT 的模型在未见测试数据上的表现。
  • 尽管在验证数据上表现优异,但模型在测试数据上的性能有所下降,尤其在未见领域和实体上,表明仍需提升泛化能力。
  • 该系统在自动评估中排名第 4,在 12 支决赛队伍中人类评估排名第 10,表明生成的响应质量高且自然。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。