Skip to main content
QUICK REVIEW

[论文解读] Learning Attractor Dynamics for Generative Memory

Yan Wu, Gregory Wayne|arXiv (Cornell University)|Nov 23, 2018
Music and Audio Processing被引用 12
一句话总结

本文提出了一种可微分的Kanerva记忆(DKM),通过最大化变分下界,使模型在无需反向传播迭代推理的情况下,学习吸引子动力学以实现鲁棒的记忆检索。该方法诱导出基于似然的李雅普诺夫函数,促使噪声或受损输入收敛至存储的模式,从而在训练过程中避免梯度消失,实现高质量去噪与生成采样。

ABSTRACT

A central challenge faced by memory systems is the robust retrieval of a stored pattern in the presence of interference due to other stored patterns and noise. A theoretically well-founded solution to robust retrieval is given by attractor dynamics, which iteratively clean up patterns during recall. However, incorporating attractor dynamics into modern deep learning systems poses difficulties: attractor basins are characterised by vanishing gradients, which are known to make training neural networks difficult. In this work, we avoid the vanishing gradient problem by training a generative distributed memory without simulating the attractor dynamics. Based on the idea of memory writing as inference, as proposed in the Kanerva Machine, we show that a likelihood-based Lyapunov function emerges from maximising the variational lower-bound of a generative memory. Experiments shows it converges to correct patterns upon iterative retrieval and achieves competitive performance as both a memory model and a generative model.

研究动机与目标

  • 解决深度学习系统在噪声和干扰下实现鲁棒记忆检索的挑战。
  • 克服阻碍神经网络中吸引子动力学训练的梯度消失问题。
  • 在深度学习框架内,实现受生物和理论模型启发的迭代、动态记忆检索。
  • 证明吸引子动力学可自然地从生成分布式记忆中的基于似然的变分目标中涌现。
  • 表明通过迭代能量最小化,该模型可同时提升去噪与采样质量,即使在未见过的噪声类型下亦然。

提出的方法

  • 使用变分推理训练生成式分布式记忆,以最大化变分下界(ELBO),从而诱导出基于似然的李雅普诺夫函数。
  • 将记忆矩阵 M 视为全局隐变量,并采用矩阵正态先验 p(M) = MN(R, U, I),其中 R 为均值,U 为行方向协方差。
  • 通过加权求和实现记忆读取:z = Σ w(k)·M(k) + ξ,其中注意力权重 w(k) 由查询向量和键向量计算得出。
  • 通过在训练后运行吸引子动力学实现迭代检索:对 ELBO 进行梯度上升以最小化能量,从而更新重构模式。
  • 基于负的变分下界定义能量函数,该函数在对受损或先验样本进行迭代优化时持续下降。
  • 通过仅训练编码器、解码器和记忆参数,避免在动力学过程中反向传播,从而规避梯度消失问题。

实验结果

研究问题

  • RQ1在不显式对迭代推理过程进行反向传播的情况下,吸引子动力学是否能在深度生成记忆模型中自然涌现?
  • RQ2基于似然的变分目标是否能自然诱导出李雅普诺夫函数,从而稳定地将检索结果导向存储的模式?
  • RQ3该模型能否在训练中未见的噪声类型(如椒盐噪声或高斯噪声)下,鲁棒地对受损模式进行去噪?
  • RQ4通过吸引子动力学的迭代优化,是否能提升从先验分布生成样本的质量?
  • RQ5该模型是否能通过增加迭代次数实现计算与精度的权衡,且在此过程中能量是否持续下降?

主要发现

  • 即使在输入高度受损(如Omniglot图像中15%椒盐噪声)的情况下,模型仍能通过迭代检索成功收敛至正确模式。
  • 能量(定义为负的变分下界)在去噪和采样过程中持续下降,证实了吸引子动力学的存在。
  • 去噪后的Omniglot模式不仅被成功恢复,且比原始图像更清晰、更平滑,表明有效实现了模式修复。
  • 从先验分布生成的初始样本质量较低,但随迭代次数增加而逐步改善,且能量随时间持续下降。
  • 系统在较大模型(如DMLab)中表现出能量波动,可能源于鞍点,但整体仍实现收敛。
  • 该方法通过不在训练中模拟动力学过程,避免了梯度消失,从而实现了高容量生成记忆的稳定训练,并可通过推理实现快速写入。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。