Skip to main content
QUICK REVIEW

[论文解读] Implementing Neural Turing Machines

Mark Collier, Joeran Beel|arXiv (Cornell University)|Jul 23, 2018
Domain Adaptation and Few-Shot Learning参考文献 9被引用 9
一句话总结

本文提出了一种稳定且高性能的神经图灵机(NTM)实现,成功在三个基准序列学习任务——复制(Copy)、重复复制(Repeat Copy)和关联回忆(Associative Recall)——上复现了原始NTM的性能。关键贡献在于识别出内存内容的常数初始化是实现快速、可靠训练的关键因素,其收敛速度比其他方案快2倍,并发布了公开可用的、基于TensorFlow的稳定实现。

ABSTRACT

Neural Turing Machines (NTMs) are an instance of Memory Augmented Neural Networks, a new class of recurrent neural networks which decouple computation from memory by introducing an external memory unit. NTMs have demonstrated superior performance over Long Short-Term Memory Cells in several sequence learning tasks. A number of open source implementations of NTMs exist but are unstable during training and/or fail to replicate the reported performance of NTMs. This paper presents the details of our successful implementation of a NTM. Our implementation learns to solve three sequential learning tasks from the original NTM paper. We find that the choice of memory contents initialization scheme is crucial in successfully implementing a NTM. Networks with memory contents initialized to small constant values converge on average 2 times faster than the next best memory contents initialization scheme.

研究动机与目标

  • 解决缺乏稳定、可复现的开源神经图灵机(NTM)实现的问题,以复现原始结果。
  • 识别并评估关键实现选择(尤其是内存内容初始化)对NTM训练稳定性与收敛速度的显著影响。
  • 使用TensorFlow开发并发布一种可靠、高性能的NTM实现,使其在标准序列学习任务上的表现与已发表结果一致。
  • 证明常数初始化内存内容可实现比随机或可学习初始化方案更快的收敛速度。

提出的方法

  • 该实现采用带有读写头的控制器网络,通过结合内容相关和位置相关的软注意力寻址机制访问外部内存矩阵。
  • 寻址机制通过一系列操作计算注意力权重:基于内容的加权(公式1)、时间插值(公式3)、基于位移的迭代(公式4)和锐化(公式5)。
  • 通过擦除和添加向量(公式7–8)执行内存更新,实现具有注意力加权影响的精确写入操作。
  • 本研究比较了五种内存初始化方案:常数、随机、可学习、Xavier和He初始化,评估其在三个序列任务上的收敛速度与稳定性。
  • 最终实现采用常数初始化内存内容,通过优化控制器头参数计算与接口设计,提升训练稳定性并增强与TensorFlow的集成性。
  • 训练在三个标准任务上进行评估:复制、重复复制和关联回忆,报告了10次训练运行的中位数误差曲线。

实验结果

研究问题

  • RQ1内存内容初始化对神经图灵机的收敛速度和训练稳定性有何影响?
  • RQ2为何许多开源NTM实现无法复现原始NTM论文中报告的性能?
  • RQ3能否开发并发布一种稳定、高性能的NTM实现,使其与原始结果一致并支持进一步研究?
  • RQ4与随机或可学习初始化相比,常数内存初始化在学习速度和可靠性方面表现如何?
  • RQ5所提出的实现是否实现了与原始NTM及其他MANN模型(如可微神经计算机DNC)相当的收敛速度?

主要发现

  • 在三个任务上,内存内容的常数初始化使收敛速度平均比次优方案(可学习初始化)快2倍。
  • 采用常数内存初始化的NTM实现,在复制任务上收敛至接近零误差的步数与最佳已发表结果及官方DNC实现相当。
  • 在重复复制任务上,NTM的收敛速度比LSTM慢1.44倍,但比DNC快1.06倍,且两种MANN模型整体均优于LSTM。
  • NTM实现以几乎与原始NTM和DNC相当的速度成功解决关联回忆任务,而LSTM在时间限制内未能解决该任务。
  • 该实现稳定可靠,未报告梯度爆炸(NaN梯度),并以开源许可证公开发布,供更广泛的研究使用。
  • 研究结论认为,内存初始化是NTM成功的关键因素,此前被忽视,应作为新实现的默认选择。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。