Skip to main content
QUICK REVIEW

[论文解读] Kronecker-factored Quasi-Newton Methods for Convolutional Neural Networks.

Yi Ren, Donald Goldfarb|arXiv (Cornell University)|Feb 12, 2021
Matrix Theory and Algorithms参考文献 30被引用 7
一句话总结

本文提出 KF-QN-CNN,一种用于训练卷积神经网络的克罗内克分解拟牛顿方法,通过使用由克罗内克积组成的逐层分块对角矩阵来近似海森矩阵,实现在一阶方法内存成本下高效的二阶优化,并在收敛性上优于当前最先进的的一阶和二阶方法。

ABSTRACT

Second-order methods have the capability of accelerating optimization by using much richer curvature information than first-order methods. However, most are impractical in a deep learning setting where the number of training parameters is huge. In this paper, we propose KF-QN-CNN, a new Kronecker-factored quasi-Newton method for training convolutional neural networks (CNNs), where the Hessian is approximated by a layer-wise block diagonal matrix and each layer's diagonal block is further approximated by a Kronecker product corresponding to the structure of the Hessian restricted to that layer. New damping and Hessian-action techniques for BFGS are designed to deal with the non-convexity and the particularly large size of Kronecker matrices in CNN models and convergence results are proved for a variant of KF-QN-CNN under relatively mild conditions. KF-QN-CNN has memory requirements comparable to first-order methods and much less per-iteration time complexity than traditional second-order methods. Compared with state-of-the-art first- and second-order methods on several CNN models, KF-QN-CNN consistently exhibited superior performance in all of our tests.

研究动机与目标

  • 为解决传统二阶方法在深度学习中因高内存和计算成本而不切实际的问题。
  • 开发一种针对卷积神经网络结构特性的曲率感知优化方法。
  • 在保持二阶优化收敛优势的同时,降低二阶优化的内存和时间复杂度。
  • 设计适用于非凸、大规模 CNN 训练的鲁棒阻尼和海森作用技术。
  • 在较弱条件下为所提方法的一个变体提供收敛性保证。

提出的方法

  • 海森矩阵被近似为逐层分块对角矩阵,其中每个块对应于某一层的参数空间。
  • 海森矩阵的每个对角块进一步被近似为克罗内克积,以利用 CNN 中的权重张量结构。
  • 引入一种新型阻尼技术,以在非凸设置下稳定更新,提升训练过程的鲁棒性。
  • 设计了一种专用的海森作用方法,可在不显式构造矩阵的情况下高效应用海森矩阵近似。
  • 对 BFGS 更新规则进行调整,使其适用于克罗内克分解的海森矩阵近似,从而保持拟牛顿性质。
  • 在较弱假设下(包括有界曲率和充分下降)证明了该方法变体的收敛性。

实验结果

研究问题

  • RQ1克罗内克分解的海森矩阵近似是否能在大规模 CNN 中实现内存和时间成本可控的二阶优化?
  • RQ2如何设计阻尼和海森作用技术,以在非凸、高维 CNN 训练中稳定训练过程?
  • RQ3所提方法在标准 CNN 架构上是否比一阶和二阶基线方法实现更快的收敛速度和更好的泛化性能?
  • RQ4在现实的深度学习条件下,KF-QN-CNN 框架的理论收敛性保证可建立到何种程度?
  • RQ5该方法是否能在保持一阶内存复杂度的同时实现二阶优化的优势?

主要发现

  • KF-QN-CNN 的内存需求与一阶方法相当,使其适用于大规模模型。
  • 该方法的每轮迭代时间复杂度显著低于传统二阶方法。
  • 在多个 CNN 模型上,KF-QN-CNN 在训练性能上持续优于当前最先进的第一和第二阶优化方法。
  • 在相对温和的条件下(包括有界曲率和充分下降),为 KF-QN-CNN 的一个变体建立了理论收敛性。
  • 所提出的阻尼和海森作用技术有效应对了非凸性以及 CNN 中大规模克罗内克矩阵带来的挑战。
  • 该方法通过克罗内克分解成功利用了 CNN 权重矩阵的结构稀疏性,实现了二阶优化的可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。