[论文解读] Knowledge-Grounded Dialogue Generation with Pre-trained Language Models
该论文提出 KnowledGPT,一种基于知识的对话生成模型,通过将基于 BERT 的知识选择模块与预训练语言模型(GPT-2)相结合,在令牌数量受限的条件下处理长篇且冗余的知识输入。通过使用未标注对话数据,以无监督方式联合优化知识选择与响应生成,该模型在两个基准测试中均达到最先进性能,在自动指标与人工评估中均优于先前方法。
We study knowledge-grounded dialogue generation with pre-trained language models. To leverage the redundant external knowledge under capacity constraint, we propose equipping response generation defined by a pre-trained language model with a knowledge selection module, and an unsupervised approach to jointly optimizing knowledge selection and response generation with unlabeled dialogues. Empirical results on two benchmarks indicate that our model can significantly outperform state-of-the-art methods in both automatic evaluation and human judgment.
研究动机与目标
- 为解决在最大序列长度受限条件下,将长篇冗余外部知识整合到预训练语言模型中的挑战。
- 克服现有基于知识的对话模型依赖昂贵人工标注知识选择或与预训练模型不兼容的局限性。
- 开发一种无监督、端到端的框架,仅使用未标注对话数据,联合优化知识选择与响应生成。
- 通过在生成前选择相关知识片段,减少噪声,提升连贯性与事实相关性,从而提高响应质量。
提出的方法
- 提出一种基于 BERT 的知识选择模块,根据对话上下文从长篇冗余知识输入中选择相关知识片段。
- 将知识选择视为序列预测任务,支持预训练技术的应用,并实现在推理过程中的动态选择。
- 采用两阶段训练策略:首先通过启发式规则生成伪真实知识;其次使用强化学习与课程学习,联合微调知识选择与响应生成。
- 采用联合优化目标,交替最大化生成响应的似然性,并通过响应模型的反馈改进知识选择。
- 使用 T_max 作为终止条件,限制所选知识令牌数量,以在召回率与噪声之间取得平衡。
- 利用预训练的 GPT-2 进行响应生成,同时使用知识选择模块对知识输入进行过滤与压缩,以适应模型上下文长度。
实验结果
研究问题
- RQ1无监督、端到端的框架是否能在无需人工标注知识选择数据的情况下,联合优化知识选择与响应生成?
- RQ2与单独训练或强基线模型相比,联合优化知识选择与响应生成在多大程度上提升了对话质量?
- RQ3知识选择模块在减少长篇对话中冗余知识输入的噪声方面有何影响?
- RQ4T_max(所选知识令牌的最大数量)的选择如何影响响应质量与知识召回之间的权衡?
- RQ5当真实标注不可用时,启发式方法生成的伪真实知识在多大程度上能有效支持联合训练?
主要发现
- KnowledGPT 在两个基准测试(Wizard of Wikipedia 和 CMU_DoG)的自动评估与人工评估指标上,显著优于最先进方法。
- 在 Wizard of Wikipedia 的测试可见数据集上,KnowledGPT 的响应 F1 得分为 28.0,优于 SKT(26.8)与 DRD(25.4),且困惑度(17.2)低于 GPT-2 截断版本(19.2)。
- 人工评估显示,KnowledGPT 在上下文连贯性与知识相关性方面均优于基线模型,且标注者间一致性较高(kappa ≥ 0.6)。
- 消融实验确认,伪真实知识阶段对 Wizard 基准的性能至关重要,因为该数据集中上下文与知识高度相关。
- 增加 T_max 可提升性能至某一临界点,但超过最优值后,F1 分数因噪声增加而下降,表明召回率与质量之间存在权衡。
- 联合优化与课程学习策略有效:若移除任一阶段,性能均会下降,证实了端到端训练的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。