Skip to main content
QUICK REVIEW

[论文解读] Memory Networks

Jason Weston, Sumit Chopra|arXiv (Cornell University)|Oct 15, 2014
Advanced Memory and Neural Computing被引用 16
一句话总结

本文提出记忆网络(memory networks),一类结合神经推理与可学习、动态长期记忆的模型,以提升问答任务中的推理能力。该方法支持有效的多跳推理,并能泛化到未见词汇,在大规模和复杂模拟问答任务中均优于RNN和LSTM。

ABSTRACT

We describe a new class of learning models called memory networks. Memory networks reason with inference components combined with a long-term memory component; they learn how to use these jointly. The long-term memory can be read and written to, with the goal of using it for prediction. We investigate these models in the context of question answering (QA) where the long-term memory effectively acts as a (dynamic) knowledge base, and the output is a textual response. We evaluate them on a large-scale QA task, and a smaller, but more complex, toy task generated from a simulated world. In the latter, we show the reasoning power of such models by chaining multiple supporting sentences to answer questions that require understanding the intension of verbs.

研究动机与目标

  • 解决标准RNN和序列模型在保留与推理长期事实信息方面的局限性。
  • 开发一种支持从动态可学习长期记忆组件读取和写入的模型架构。
  • 在问答任务中实现对多个支持性事实的推理,尤其针对需要理解动词语义及时间/因果关系的任务。
  • 通过学习语言模式,在零样本或少样本设置下实现对未见词汇的泛化。
  • 探索模拟世界学习与真实世界知识库的结合,以增强模型的鲁棒性与推理能力。

提出的方法

  • 定义一个包含四个组件的记忆网络框架:输入特征映射(I)、泛化(G)、输出特征映射(O)和响应(R),以支持模块化学习与记忆交互。
  • 实现一种特定的神经实例化方法,称为MemNN,其中I、G、O和R均以神经网络实现,且G根据新输入更新记忆槽。
  • 采用记忆查找机制,其中O计算输入向量与记忆向量之间的相关性得分,并对最相关的记忆进行注意力聚合以进行推理。
  • 使用监督学习端到端训练模型,以问答对为监督信号,通过梯度下降优化响应准确率。
  • 在真实问答数据微调前,先在模拟数据上进行无监督预训练,以学习语言模式(如(X, dropped, Y))。
  • 通过在包含掩码词汇的合成故事上训练,学习基于动词的关系模式,实现对未见词汇的零样本泛化。

实验结果

研究问题

  • RQ1具有可学习、动态记忆组件的神经模型是否能在复杂问答任务中超越标准RNN和LSTM?
  • RQ2通过从动词和句子结构中学习关系模式,记忆网络在多大程度上能泛化到未见词汇?
  • RQ3记忆网络能否通过链式连接多个支持性事实,以回答需要多跳推理及动词语义理解的问题?
  • RQ4模拟世界训练与真实世界问答数据结合,在提升模型泛化能力和推理能力方面有多高效?
  • RQ5在仅有问答对而无显式支持事实监督的弱监督设置下,记忆网络是否能有效训练?

主要发现

  • MemNN在大规模问答和复杂模拟问答任务中均优于RNN和LSTM,展现出更优的推理与记忆能力。
  • 该模型通过链式连接多个支持性句子,成功回答需要多跳推理的问题,例如通过一系列事件追踪物体位置。
  • MemNN通过学习动词形式(如(X, took, Y)和(X, journeyed to, Y))的关系模式,成功泛化到未见词汇(如Bilbo、Frodo、Gollum)。
  • 若不采用未见词汇建模方法,模型在OOV(未登录词)上完全失效,凸显基于模式泛化的关键作用。
  • 在模拟数据和真实世界问答数据上联合训练的MemNN集成模型,可处理混合对话,准确回答通用知识与故事特异性问题。
  • 在复杂对话中,模型能生成连贯且符合语境的响应,例如根据一系列动作正确识别出牛奶的位置。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。