Skip to main content
QUICK REVIEW

[论文解读] Taylorized Training: Towards Better Approximation of Neural Network Training at Finite Width

Yu Bai, Ben Krause|arXiv (Cornell University)|Feb 10, 2020
Stochastic Gradient Optimization Techniques参考文献 40被引用 12
一句话总结

本文提出Taylor化训练(Taylorized training),一种通过在初始化点处将神经网络输出展开至k阶泰勒多项式来近似神经网络训练的方法。实验证明,高阶Taylor化模型(尤其是四阶)在标准训练设置下,显著优于线性化训练,并在权重空间与函数空间中更贴近完整网络训练,使CIFAR-10上的性能差距缩小70-80%。

ABSTRACT

We propose \emph{Taylorized training} as an initiative towards better understanding neural network training at finite width. Taylorized training involves training the $k$-th order Taylor expansion of the neural network at initialization, and is a principled extension of linearized training---a recently proposed theory for understanding the success of deep learning. We experiment with Taylorized training on modern neural network architectures, and show that Taylorized training (1) agrees with full neural network training increasingly better as we increase $k$, and (2) can significantly close the performance gap between linearized and full training. Compared with linearized training, higher-order training works in more realistic settings such as standard parameterization and large (initial) learning rate. We complement our experiments with theoretical results showing that the approximation error of $k$-th order Taylorized models decay exponentially over $k$ in wide neural networks.

研究动机与目标

  • 为解决在实际深度学习设置中,由于使用大学习率和有限宽度而导致线性化训练方法的局限性。
  • 探究在有限宽度下,高阶泰勒展开是否能更优地近似完整神经网络训练的动力学。
  • 在实际设置中缩小线性化模型与全训练网络之间的性能差距。
  • 探索Taylor化训练作为分析神经网络行为(如层重要性与参数移动)的工具的实用性。

提出的方法

  • 该方法将神经网络输出 fθ(x) 在初始化点 θ₀ 处展开至k阶泰勒级数:f^{(k)}_{θ;θ₀}(x) = f_{θ₀}(x) + Σ_{j=1}^k [∇^j_θ f_{θ₀}(x) / j!] ⋅ (θ−θ₀)^⊗j。
  • Taylor化训练通过显式训练k阶泰勒近似 f^{(k)}_{θ;θ₀}(x) 而非完整网络 fθ(x) 来实现。
  • 该方法在标准架构(如ResNet、CNN)上应用,且在实际训练条件下进行:使用标准参数化与较大的初始学习率。
  • 通过比较不同k值下全训练与Taylor化训练的训练轨迹、测试准确率及参数移动,评估近似质量。
  • 理论分析表明,在宽网络中,k阶模型的近似误差随k呈指数级衰减。
  • 通过分析Taylor化训练中不同层的参数更新幅度,研究层的重要性。

实验结果

研究问题

  • RQ1在有限宽度下,高阶Taylor化模型是否能比线性化模型更优地近似完整神经网络训练?
  • RQ2Taylor化训练在使用大学习率与标准参数化的实际设置中表现如何?
  • RQ3提高泰勒展开阶数k在多大程度上能减少线性化训练与全训练之间的性能差距?
  • RQ4Taylor化训练是否能揭示关于层重要性与参数移动动态的洞见?
  • RQ5在宽网络中,k阶模型的近似误差是否随k的增加而呈指数级衰减?

主要发现

  • 在CIFAR-10上,k=4(四阶)的Taylor化训练使线性化模型与全训练之间的测试准确率差距缩小70-80%,其性能仅比全训练差10-15%。
  • 高阶Taylor化模型(k≥2)即使在大学习率下,也能在参数空间与函数空间中更优地逼近全训练轨迹。
  • 四阶Taylor化模型显著优于线性化训练,后者通常比全训练损失超过40%的准确率。
  • 理论分析证实,在宽网络中,k阶模型的近似误差随k呈指数级衰减,支持了实证趋势。
  • Taylor化训练揭示,训练过程中深层网络移动幅度小于浅层网络,暗示层重要性的层级结构。
  • 该方法在标准超参数设置下,比线性化训练更能真实地建模有限宽度训练的动力学。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。