Skip to main content
QUICK REVIEW

[论文解读] Meta Learning Backpropagation And Improving It

Louis Kirsch, Jürgen Schmidhuber|arXiv (Cornell University)|Dec 29, 2020
Domain Adaptation and Few-Shot Learning参考文献 52被引用 8
一句话总结

该论文提出了一种新型元学习框架——可变共享元学习(VSML),用共享的稀疏LSTM替代神经网络权重,实现反向传播类似学习算法的端到端可微分学习。该方法仅通过前向动力学学习通用的、无梯度的规则,实现了卓越的样本效率,并能泛化到未见过的数据集(如Fashion MNIST),而无需显式计算梯度。

ABSTRACT

Many concepts have been proposed for meta learning with neural networks (NNs), e.g., NNs that learn to reprogram fast weights, Hebbian plasticity, learned learning rules, and meta recurrent NNs. Our Variable Shared Meta Learning (VSML) unifies the above and demonstrates that simple weight-sharing and sparsity in an NN is sufficient to express powerful learning algorithms (LAs) in a reusable fashion. A simple implementation of VSML where the weights of a neural network are replaced by tiny LSTMs allows for implementing the backpropagation LA solely by running in forward-mode. It can even meta learn new LAs that differ from online backpropagation and generalize to datasets outside of the meta training distribution without explicit gradient calculation. Introspection reveals that our meta learned LAs learn through fast association in a way that is qualitatively different from gradient descent.

研究动机与目标

  • 开发一种元学习框架,能够学习通用的学习算法(LAs),而无需依赖固定的人工设计组件(如反向传播)。
  • 通过权重共享和稀疏性强制实现 $|V_L| \gg |V_M|$ 的大比例,以解决现有元学习方法过度拟合于特定任务解决方案的局限性。
  • 证明强大的、可重用的学习算法(如反向传播)可被隐式编码于循环动力学中,而无需符号编程或硬编码的计算图。
  • 实现元优化的学习算法,使其在多样化数据集上泛化,并超越元训练分布,包括对分布外任务(如从MNIST到Fashion MNIST)的泛化。

提出的方法

  • 用小型共享LSTM替换标准神经网络权重,构建可变共享元学习(VSML)架构。
  • 在权重矩阵中使用稀疏连接,以减少参数量同时保持表达能力,实现高效的参数复用。
  • 通过元优化进行端到端训练,其中RNN通过前向模式动力学学习实现学习规则。
  • 将系统解释为单一稀疏共享权重RNN,或多个通过消息传递的RNN,通过循环动力学实现涌现的信用分配。
  • 采用元优化循环,其中RNN在任务分布上进行训练,以学习通用的学习算法。
  • 应用自省与学习算法克隆,验证所学LAs执行快速关联学习,与梯度下降有本质区别。

实验结果

研究问题

  • RQ1神经网络能否仅通过前向模式动力学学习实现反向传播,而无需显式计算梯度?
  • RQ2元学习到的学习算法能否泛化到元训练分布之外的数据集,如从MNIST到Fashion MNIST?
  • RQ3元学习到的学习算法与随机梯度下降相比,是否表现出定性不同的学习动力学?
  • RQ4RNN架构中的权重共享与稀疏性能否实现通用、可重用的学习算法的发现?
  • RQ5VSML在样本效率和泛化能力方面与标准反向传播相比表现如何?

主要发现

  • VSML成功仅通过前向模式动力学学习实现类似反向传播的学习算法,无需显式梯度计算或符号编程。
  • 元学习到的学习算法能泛化到未见数据集(如Fashion MNIST),即使仅在MNIST上训练,表明其具有强大的分布外泛化能力。
  • 自省分析显示,所学LAs依赖于快速关联机制而非梯度下降,表明其学习过程具有本质不同的特性。
  • 该系统在MNIST上实现了具有竞争力的性能,并在少样本或持续学习设置下相比标准反向传播展现出更高的样本效率。
  • 该方法在多样化环境和任务中均表现出泛化能力,表明其在持续学习和样本高效学习中具有更广泛的应用潜力。
  • 尽管结果令人鼓舞,当前实现仍存在过早收敛和计算成本高于标准反向传播的问题,表明仍有优化与扩展空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。