Skip to main content
QUICK REVIEW

[論文レビュー] Fast Approximation of the Gauss-Newton Hessian Matrix for the Multilayer Perceptron

Chao Chen, Severin Reiz|arXiv (Cornell University)|Oct 27, 2019
Stochastic Gradient Optimization Techniques参考文献 46被引用数 4
ひとこと要約

本稿では、多層パーセプトロンにおけるガウス・ニュートン・ヘッシアン(GNH)行列のエントリごとの近似に対して、高速なモンテカルロサンプリングアルゴリズムを提示する。計算コストをエントリあたり 𝒪(Nn) から 𝒪(n + d/ε²) に削減する。この手法により、効率的なハイパースペース行列(ℋ-)の構築が可能となる。

ABSTRACT

We introduce a fast algorithm for entry-wise evaluation of the Gauss-Newton Hessian (GNH) matrix for the fully-connected feed-forward neural network. The algorithm has a precomputation step and a sampling step. While it generally requires $O(Nn)$ work to compute an entry (and the entire column) in the GNH matrix for a neural network with $N$ parameters and $n$ data points, our fast sampling algorithm reduces the cost to $O(n+d/ε^2)$ work, where $d$ is the output dimension of the network and $ε$ is a prescribed accuracy (independent of $N$). One application of our algorithm is constructing the hierarchical-matrix (H-matrix) approximation of the GNH matrix for solving linear systems and eigenvalue problems. It generally requires $O(N^2)$ memory and $O(N^3)$ work to store and factorize the GNH matrix, respectively. The H-matrix approximation requires only $O(N r_o)$ memory footprint and $O(N r_o^2)$ work to be factorized, where $r_o \ll N$ is the maximum rank of off-diagonal blocks in the GNH matrix. We demonstrate the performance of our fast algorithm and the H-matrix approximation on classification and autoencoder neural networks.

研究の動機と目的

  • 完全に接続された順方向ニューラルネットワークにおけるガウス・ニュートン・ヘッシアン(GNH)行列のエントリごとの評価のための高速でスケーラブルな手法の開発。
  • GNH行列の評価にかかる計算コストを、パrameter数 N に依存しない形で、エントリあたり 𝒪(Nn) から 𝒪(n + d/ε²) に削減すること。
  • GNH行列のハイパースペース行列(ℋ行列)近似を効率的に構築できることを可能にすること。
  • MNISTおよびCIFAR-10データセットを用いた分類ネットワークおよびオートエンコーダーにおいて、本手法の有効性を実証すること。
  • McDiarmidの不等式を用いたサンプリング精度の理論的保証を提示し、数値実験で収束を検証すること。

提案手法

  • 中間のヤコビアンおよびヘッシアン項を事前計算する段階と、ランダムサンプリングによりGNHエントリを推定する段階に分かれる2段階のアルゴリズムを導入する。
  • GNH行列の構造を H = JᵀQJ として活用し、J は出力に対する重みに関するヤコビアン、Q は損失関数のヘッシアンである。
  • モンテカルロサンプリングを用いて、JᵢᵀQᵢJᵢ の確率的推定値を計算することで、H の個々のエントリを近似する。
  • McDiarmidの不等式を適用し、サンプリング誤差の上限を導出し、真のGNHエントリに高い確率で収束することを保証する。
  • サンプルを得たエントリを用いてℋ行列近似を構築し、メモリを 𝒪(N²) から 𝒪(Nrₒ) に、因子分解コストを 𝒪(N³) から 𝒪(Nrₒ²) に削減する。ここで rₒ ≪ N は非対角ブロックのランクである。
  • サンプリングアルゴリズムをℋ行列構築パイプラインに統合し、GNH行列の高速かつ高精度な低ランク近似を実現する。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークにおけるガウス・ニュートン・ヘッシアン行列のエントリ評価の計算コストを顕著に低減できるか?
  • RQ2事前計算された項に基づく確率的サンプリングアプローチは、パrameter数 N に対して非線形的依存性を示しつつも、高い精度を達成できるか?
  • RQ3提案されたサンプリング手法により、GNH行列の効率的かつ高精度なハイパースペース行列(ℋ行列)近似が可能になるか?
  • RQ4サンプル数と所望の精度 ε に対して、サンプリング誤差はどのようにスケーリングされるか?また、理論的境界を確立できるか?
  • RQ5得られたℋ行列近似は、実際の線形方程式系やGNH行列に関する固有値問題の解法に効果的に応用できるか?

主な発見

  • 提案されたアルゴリズムにより、GNH行列エントリの評価コストが 𝒪(Nn) から 𝒪(n + d/ε²) に削減され、大規模ネットワークにおいて顕著な高速化が達成された。
  • MNISTオートエンコーダーでは、10,000サンプルを用いて6.1×10⁻²のフロベニウスノルム誤差で1.68%の圧縮率を達成し、サンプル数を増やすと誤差が減少した。
  • CIFAR-10では、10,000サンプルで7.3×10⁻²のフロベニウスノルム誤差で4.83%の圧縮率を達成し、高い精度を維持した。
  • サンプル数を増やすに従い、サンプリング誤差はゼロに収束し、ℋ行列近似誤差も減少した。これにより、全体のアプローチの有効性が裏付けられた。
  • 同等の精度を達成するための必要サンプル数において、本手法は一様サンプリングを100倍も上回るサンプリング効率を示した。
  • VGGネットワークにおける予備実験の結果、本手法は畳み込みアーキテクチャにも一般化可能であることが示唆され、より広範な応用可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。