Skip to main content
QUICK REVIEW

[論文レビュー] Kronecker-factored Quasi-Newton Methods for Convolutional Neural Networks.

Yi Ren, Donald Goldfarb|arXiv (Cornell University)|Feb 12, 2021
Matrix Theory and Algorithms参考文献 30被引用数 7
ひとこと要約

本稿では、畳み込みニューラルネットワークの学習に適したKronecker因数分解された準ニュートン法(KF-QN-CNN)を提案する。この手法は、畳み込みニューラルネットワークの重み行列構造を活用して、各層ごとのブロック対角行列をKronecker積の形で近似することで、ヘッセ行列を近似する。これにより、1次順のメモリコストで効率的な2次順最適化が可能となり、最先端の1次および2次順最適化手法よりも優れた収束性能を達成する。

ABSTRACT

Second-order methods have the capability of accelerating optimization by using much richer curvature information than first-order methods. However, most are impractical in a deep learning setting where the number of training parameters is huge. In this paper, we propose KF-QN-CNN, a new Kronecker-factored quasi-Newton method for training convolutional neural networks (CNNs), where the Hessian is approximated by a layer-wise block diagonal matrix and each layer's diagonal block is further approximated by a Kronecker product corresponding to the structure of the Hessian restricted to that layer. New damping and Hessian-action techniques for BFGS are designed to deal with the non-convexity and the particularly large size of Kronecker matrices in CNN models and convergence results are proved for a variant of KF-QN-CNN under relatively mild conditions. KF-QN-CNN has memory requirements comparable to first-order methods and much less per-iteration time complexity than traditional second-order methods. Compared with state-of-the-art first- and second-order methods on several CNN models, KF-QN-CNN consistently exhibited superior performance in all of our tests.

研究の動機と目的

  • 深層学習における伝統的な2次順最適化手法が、高いメモリおよび計算コストのため実用的でないという問題に対処すること。
  • 畳み込みニューラルネットワークの構造的特性に適合した曲率に配慮した最適化手法を開発すること。
  • 2次順最適化の収束利点を維持しつつ、そのメモリおよび時間計算量を低減すること。
  • 非凸的で大規模なCNN学習に適した、安定性の高いダミングおよびヘッセ作用法を設計すること。
  • やや弱い条件下でも、提案手法の変種に対して収束保証を確立すること。

提案手法

  • ヘッセ行列を、各層のパラメータ空間に対応する層ごとのブロック対角行列として近似する。
  • 各対角ブロックを、CNNにおける重みテンソル構造を活用してKronecker積の形でさらに近似する。
  • 非凸的設定での更新を安定化させるために、新たなダミング手法を導入し、学習中のロバスト性を向上させる。
  • 明示的な行列表現を生成せずに、ヘッセ行列近似を効率的に適用するための特化したヘッセ作用法を設計する。
  • BFGS更新則をKronecker因数分解されたヘッセ行列近似に適合させ、準ニュートン特性を保持する。
  • 有界な曲率と十分な降下が保証される弱い仮定の下で、KF-QN-CNNの変種の収束性を証明する。

実験結果

リサーチクエスチョン

  • RQ1Kronecker因数分解されたヘッセ行列近似は、管理可能なメモリおよび時間コストで大規模なCNNに2次順最適化を可能にするか?
  • RQ2非凸的で高次元のCNN学習において、安定性を高めるためにダミングおよびヘッセ作用法をどのように設計できるか?
  • RQ3提案手法は、標準的なCNNアーキテクチャにおいて、最先端の1次および2次順ベースラインよりも高速な収束と優れた一般化性能を達成するか?
  • RQ4現実的な深層学習条件の下で、KF-QN-CNNフレームワークに対してどのような理論的収束保証を確立できるか?
  • RQ51次順のメモリコストを維持しつつ、2次順最適化の利点を達成できるか?

主な発見

  • KF-QN-CNNは、1次順最適化手法と同等のメモリ要件を達成しており、大規模モデルに対しても実用的である。
  • 従来の2次順最適化手法と比較して、1イテレーションあたりの時間計算量が顕著に低い。
  • 複数のCNNモデルにおいて、KF-QN-CNNは最先端の1次および2次順最適化手法を一貫して上回る学習性能を示した。
  • 有界な曲率と十分な降下というやや弱い条件下でも、KF-QN-CNNの変種の理論的収束性が確立された。
  • 提案されたダミングおよびヘッセ作用法は、CNNにおける非凸性および大規模Kronecker行列の課題を効果的に管理した。
  • Kronecker分解を用いてCNN重み行列の構造的スパarsityを活用することで、2次順最適化のスケーラビリティを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。