Skip to main content
QUICK REVIEW

[论文解读] Are Pre-trained Language Models Knowledgeable to Ground Open Domain Dialogues?

Yufan Zhao, Wei Wu|arXiv (Cornell University)|Nov 19, 2020
Topic Modeling参考文献 21被引用 9
一句话总结

本文研究了预训练语言模型(PLMs)是否可以在不依赖外部知识源的情况下,作为开放域对话生成的内部知识库。通过在少量富含知识的对话上微调DialoGPT和GPT-2等PLM,模型生成的回复在性能上可与依赖外部知识的最先进模型相媲美,表明PLM已编码足够知识,可用于生成有依据、连贯且具体化的对话。

ABSTRACT

We study knowledge-grounded dialogue generation with pre-trained language models. Instead of pursuing new state-of-the-art on benchmarks, we try to understand if the knowledge stored in parameters of the pre-trained models is already enough to ground open domain dialogues, and thus allows us to get rid of the dependency on external knowledge sources in generation. Through extensive experiments on benchmarks, we find that by fine-tuning with a few dialogues containing knowledge, the pre-trained language models can outperform the state-of-the-art model that requires external knowledge in automatic evaluation and human judgment, suggesting a positive answer to the question we raised.

研究动机与目标

  • 探究预训练语言模型(PLMs)是否内在包含足够知识,可在不依赖外部知识源的情况下实现开放域对话的有据生成。
  • 评估在少量富含知识的对话上微调PLM,是否可使其生成的回复在信息量和相关性上与依赖外部知识的模型相当。
  • 通过自动指标和人工评估,对比PLM(如DialoGPT、GPT-2)与依赖外部知识的最先进模型的性能表现。
  • 理解PLM在保留和正确应用事实性知识(尤其是数字、时间、地点等细节)方面的局限性。

提出的方法

  • 在三个基准的数据集(Wizard of Wikipedia、CMU DoG、Topical-Chat)的对话数据上微调大规模预训练语言模型(DialoGPT和GPT-2),仅使用包含知识的对话数据。
  • 在训练和推理过程中摒弃外部知识源,完全依赖模型参数中编码的知识。
  • 使用BLEU、ROUGE、F1和困惑度(PPL)等自动评估指标,与基线模型比较回复质量。
  • 对500个采样的测试对话进行人工评估,由四位标注员使用二元标签评估流畅性、连贯性、知识存在性、相关性和正确性。
  • 使用Fleiss’ Kappa测量标注者间一致性,以确保人工判断的可靠性。
  • 将仅在对话数据上微调的模型(DialoGPT finetune、GPT-2 finetune)与使用外部知识的强基线模型(DRD)进行性能比较。

实验结果

研究问题

  • RQ1预训练语言模型是否可在无外部知识源访问的情况下,生成有依据的、富含知识的开放域对话回复?
  • RQ2在少量富含知识的对话上进行微调,能在多大程度上提升PLM生成相关且事实正确回复的能力?
  • RQ3在自动评估和人工评估下,PLM的性能与事实准确性与依赖外部知识的最先进模型相比如何?
  • RQ4PLM在知识有据对话中的主要失败模式是什么,特别是关于数字、时间、地点等事实细节方面?

主要发现

  • 在少量富含知识的对话上微调后,DialoGPT finetune在自动指标(如F1)上优于最先进模型DRD,尤其在CMU DoG基准上表现突出。
  • 人工评估显示,微调后的PLM生成的回复具有高流畅性和连贯性,能有效传递相关知识,但有时在具体细节上出现事实性错误。
  • 人工评估揭示了显著的标注者间一致性(所有Fleiss’ Kappa值均>0.6),验证了判断过程的可靠性。
  • 尽管性能有所提升,微调后的PLM偶尔会生硬地组合知识片段或生成通用化回复,表明其在结构化知识整合方面仍面临挑战。
  • 结果表明,预训练语言模型已包含足够知识,可用于有据的开放域对话生成,尤其在针对特定主题的对话上进行微调后,可显著降低对外部知识源的依赖。
  • GPT-2 finetune的表现弱于DialoGPT finetune,可能由于微调数据量较小,且该模型缺乏对话特定的预训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。