Skip to main content
QUICK REVIEW

[论文解读] Extending Neural Generative Conversational Model using External Knowledge Sources

Prasanna Parthasarathi, Joëlle Pineau|arXiv (Cornell University)|Sep 14, 2018
Topic Modeling参考文献 21被引用 7
一句话总结

该论文提出了一种扩展的编码器-解码器(Ext-ED)架构,将非结构化的外部知识(如维基百科摘要和NELL知识库)整合到神经生成对话模型中,以提升响应连贯性和训练效率。通过在解码过程中学习预测并利用外部上下文向量,该模型实现了更快的收敛速度和更低的困惑度(使用NELL知识库时为29.07),优于基线Seq2Seq模型。

ABSTRACT

The use of connectionist approaches in conversational agents has been progressing rapidly due to the availability of large corpora. However current generative dialogue models often lack coherence and are content poor. This work proposes an architecture to incorporate unstructured knowledge sources to enhance the next utterance prediction in chit-chat type of generative dialogue models. We focus on Sequence-to-Sequence (Seq2Seq) conversational agents trained with the Reddit News dataset, and consider incorporating external knowledge from Wikipedia summaries as well as from the NELL knowledge base. Our experiments show faster training time and improved perplexity when leveraging external knowledge.

研究动机与目标

  • 为解决当前生成式对话模型在生成连贯、内容丰富的响应方面存在的局限性,通过整合外部知识源。
  • 通过利用结构化和非结构化知识作为辅助上下文,减少训练时间并提升模型收敛性。
  • 评估不同外部知识源(维基百科摘要和NELL知识库)对模型性能和训练动态的影响。
  • 探究外部知识是否可作为对话上下文的补充信号,从而在仅依赖对话历史的基础上进一步提升响应生成质量。
  • 探索在无需复杂记忆机制的情况下,将非结构化知识源用于端到端可训练的生成模型的可行性。

提出的方法

  • 通过在训练过程中从维基百科摘要或NELL知识库等知识源学习外部上下文向量 $\bm{ec^{i}}$,扩展标准Seq2Seq架构。
  • 使用包含知识预测损失 $\mathcal{L}_3$ 的多任务损失函数进行模型训练,以促使模型学习外部上下文的有用表征。
  • 在推理阶段,将解码器同时基于编码的对话上下文和预测的 $\bm{ec^{i}}$ 向量进行条件化,以生成更具信息量的响应。
  • 使用可学习的投影头将外部知识映射到连续的 $\mathbb{R}^{100}$ 向量空间,确保与RNN解码器的兼容性。
  • 通过 $\mathcal{L}_3$ 的反向传播,确保模型能够有效利用外部上下文,避免在训练过程中忽略其存在。
  • 使用 $\mathcal{N}(4,1)$ 对外部上下文向量进行缩放,以增加其方差,提升其在作为输入时的信息量。

实验结果

研究问题

  • RQ1来自维基百科和NELL知识库等非结构化源的外部知识是否能提升生成对话响应的连贯性和内容丰富度?
  • RQ2与标准Seq2Seq模型相比,整合外部知识是否能减少训练时间并加速模型收敛?
  • RQ3外部知识向量的方差如何影响其在条件化响应生成过程中的实用性?
  • RQ4外部知识与对话上下文在预测下一个话语时的相对贡献如何?
  • RQ5一个简单且可学习的外部上下文向量能否在保持性能的前提下替代对话模型中的复杂记忆机制?

主要发现

  • 使用NELL知识库的Ext-ED模型困惑度为29.07,使用维基百科摘要的模型为30.26,显著低于基线Seq2Seq模型(38.09),表明响应预测准确度得到提升。
  • 采用 $\mathcal{L}_3$ 损失(知识预测损失)的模型性能优于消融变体,表明当梯度通过 $\mathcal{L}_3$ 反向传播时,模型能够有效利用外部上下文。
  • 通过 $\mathcal{N}(4,1)$ 对外部上下文向量进行缩放,增加了其方差,从而提升了模型性能,并有助于防止模型在训练过程中忽略外部上下文。
  • NELL知识库向量的方差为1.44,而维基百科向量的方差较低,为0.73;且NELL向量到均值的平均距离(2.16)高于维基百科(0.77),表明维基百科向量分布更集中,信息量更低。
  • 无 $\mathcal{L}_3$ 的消融模型困惑度高达601.8,表明当外部上下文未被正确整合时,模型无法生成有意义的响应,凸显了知识损失的重要性。
  • 引入外部知识的模型收敛速度更快,BLEU-4得分提升至0.525(使用NELL知识库),优于基线模型的0.437,表明生成响应的流畅性和相关性得到改善。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。