Skip to main content
QUICK REVIEW

[论文解读] MEMO: A Deep Network for Flexible Combination of Episodic Memories

Andrea Banino, Adrià Puigdomènech Badia|arXiv (Cornell University)|Jan 29, 2020
Domain Adaptation and Few-Shot Learning参考文献 48被引用 7
一句话总结

MEMO 提出了一种新颖的深度神经网络架构,通过将存储的事实与其组成部分解耦,并采用自适应检索机制,在外部记忆中实现灵活的多跳推理。该模型在 bAbI 数据集上达到最先进性能,并在长距离关联推理和最短路径任务上优于现有模型,通过学习的记忆跳跃展现出强大的泛化能力。

ABSTRACT

Recent research developing neural network architectures with external memory have often used the benchmark bAbI question and answering dataset which provides a challenging number of tasks requiring reasoning. Here we employed a classic associative inference task from the memory-based reasoning neuroscience literature in order to more carefully probe the reasoning capacity of existing memory-augmented architectures. This task is thought to capture the essence of reasoning -- the appreciation of distant relationships among elements distributed across multiple facts or memories. Surprisingly, we found that current architectures struggle to reason over long distance associations. Similar results were obtained on a more complex task involving finding the shortest path between nodes in a path. We therefore developed MEMO, an architecture endowed with the capacity to reason over longer distances. This was accomplished with the addition of two novel components. First, it introduces a separation between memories (facts) stored in external memory and the items that comprise these facts in external memory. Second, it makes use of an adaptive retrieval mechanism, allowing a variable number of "memory hops" before the answer is produced. MEMO is capable of solving our novel reasoning tasks, as well as match state of the art results in bAbI.

研究动机与目标

  • 探究现有记忆增强神经网络在长距离关联推理方面的局限性。
  • 开发一种支持通过灵活组合分离的情景记忆实现推理的模型,受海马体功能的启发。
  • 通过基于任务复杂度的自适应记忆跳跃次数,解决固定计算时间的问题。
  • 构建一种更具泛化能力的架构,通过程序化生成推理任务避免退化解。
  • 在标准基准(如 bAbI)之外的新任务上评估性能,包括成对关联推理和最短路径查找。

提出的方法

  • 在外部记忆中存储的事实与其组成元素之间实现分离,实现更细粒度的操控。
  • 采用循环注意力机制,支持可变长度的记忆检索,每次跳跃均基于先前交互结果优化查询。
  • 使用自适应停止机制(ACT),根据推理任务的复杂度动态确定所需的记忆跳跃次数。
  • 对记忆内容应用线性投影,并使用可学习的查询机制,在多跳过程中加权相关记忆槽。
  • 固定记忆大小和参数,确保相对于输入句子数量的时间复杂度为线性,不同于如通用变换器(Universal Transformer)等二次复杂度模型。
  • 采用可微分的基于注意力的记忆读写机制,由控制器网络(LSTM)处理查询并迭代更新记忆状态。

实验结果

研究问题

  • RQ1现有记忆增强网络能否泛化到需要长距离关联的新型程序化推理任务?
  • RQ2记忆跳跃次数如何影响需要跨分离事实进行推理的任务上的推理性能?
  • RQ3与固定跳跃次数的模型相比,自适应计算机制是否能提升推理效率和准确性?
  • RQ4在记忆中将事实与其组成部分解耦,是否能提升模型执行推理性思维的能力?
  • RQ5MEMO 在推理基准上与最先进模型(如 DNC、EMN 和通用变换器)相比表现如何?

主要发现

  • MEMO 在新型成对关联推理(PAI)任务上显著优于现有模型,包括 DNC 和 EMN,该任务要求对长距离关联进行推理。
  • MEMO 在 bAbI 问答基准上达到最先进性能,以高准确率解决了全部 100 项任务。
  • 该模型在最短路径任务上表现出稳健的泛化能力,解决了 95% 的实例,而基线模型在更长路径上失败。
  • 自适应跳跃机制使 MEMO 能够根据每个任务的需求仅使用必要的跳跃次数,减少计算量而不损失性能。
  • 事实与其组成部分的分离提升了推理效率,如在未见的 PAI 实例上实现改进的零样本泛化性能所示。
  • MEMO 保持了与输入长度呈线性的时间复杂度,使其比如通用变换器等二次复杂度模型更高效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。