Skip to main content
QUICK REVIEW

[论文解读] Learning by Turning: Neural Architecture Aware Optimisation

Yang Liu, Jeremy Bernstein|arXiv (Cornell University)|Feb 14, 2021
Neural Networks and Applications参考文献 45被引用 5
一句话总结

本文提出 Nero,一种新型神经优化器,通过使用学习率作为旋转角度对平衡网络中的每个神经元进行逐神经元投影梯度下降。Nero 在多种深度学习任务中实现了最先进性能,且超参数调优极少,优于 Adam 和 SGD,尤其在具有挑战性的设置中表现更优,同时内存占用仅为 Adam 或 LAMB 的 √1/2。

ABSTRACT

Descent methods for deep networks are notoriously capricious: they require careful tuning of step size, momentum and weight decay, and which method will work best on a new benchmark is a priori unclear. To address this problem, this paper conducts a combined study of neural architecture and optimisation, leading to a new optimiser called Nero: the neuronal rotator. Nero trains reliably without momentum or weight decay, works in situations where Adam and SGD fail, and requires little to no learning rate tuning. Also, Nero's memory footprint is ~ square root that of Adam or LAMB. Nero combines two ideas: (1) projected gradient descent over the space of balanced networks; (2) neuron-specific updates, where the step size sets the angle through which each neuron's hyperplane turns. The paper concludes by discussing how this geometric connection between architecture and optimisation may impact theories of generalisation in deep learning.

研究动机与目标

  • 解决标准深度学习优化器(如 Adam 和 SGD)的脆弱性与超参数敏感性问题。
  • 研究神经架构设计与优化动态之间的耦合关系,以减少对启发式调优的依赖。
  • 开发一种能自然融入平衡神经网络几何结构的优化器。
  • 探索架构约束如何影响深度网络的泛化能力和学习稳定性。
  • 降低内存开销,提升训练可靠性,且无需使用动量或权重衰减。

提出的方法

  • 将优化域形式化为超球面的笛卡尔积,以表示每个神经元权重位于单位球面上的平衡网络。
  • 在此约束流形上实施投影梯度下降,以在整个训练过程中保持权重平衡。
  • 引入神经元特定的更新方式,其中学习率控制每个神经元超平面的旋转角度。
  • 将权重更新的几何解释为超球面空间中的旋转,从而无需使用动量或权重衰减。
  • 采用内存高效的更新规则,其复杂度相对于 Adam 或 LAMB 为 √(d),显著降低内存占用。
  • 利用神经架构的内在对称性与结构特性引导优化过程,提升泛化能力。

实验结果

研究问题

  • RQ1优化深度网络权重的最佳域是什么?它与权重平衡等架构约束有何关系?
  • RQ2优化应在何种粒度级别上进行——逐突触、逐层,还是逐神经元——以提升训练稳定性?
  • RQ3能否通过超球面流形的几何洞察,设计出更鲁棒且对超参数不敏感的优化器?
  • RQ4架构与优化之间的相互作用如何影响深度神经网络的泛化能力?
  • RQ5通过将正则化与网络的架构结构对齐,能否使正则化更易解释且更有效?

主要发现

  • Nero 在图像分类、图像生成、自然语言处理和强化学习任务中均表现出色,且无需学习率调优。
  • 在除两个实验(100层 MLP 和 WMT16 En–De Transformer)外的所有实验中,Nero 均使用默认超参数成功训练,且优于调优后的基线模型。
  • Nero 的内存占用约为 Adam 或 LAMB 的 √1/2,显著降低了内存开销。
  • Nero 消除了对动量和权重衰减的需求,转而依赖几何投影与角度更新。
  • 理论分析表明,泛化误差受参数数量、数据集大小以及不同鲁棒解数量的对数的限制,暗示在过参数化设置下泛化能力得到提升。
  • 将增益参数正则化至 1 比标准权重衰减更有效且更易解释,凸显了架构感知正则化的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。