Skip to main content
QUICK REVIEW

[論文レビュー] Pathological spectra of the Fisher information metric and its variants in deep neural networks

Ryo Karakida, Shotaro Akaho|arXiv (Cornell University)|Oct 14, 2019
Statistical Mechanics and Entropy参考文献 45被引用数 10
ひとこと要約

本論文は、広大でランダムに初期化された深層ニューラルネットワークにおけるフィッシャー情報計量(FIM)およびその変種が、病理的とされる固有値スペクトルを示すことを明らかにした。少数の固有値が極端な外れ値となり、残りの大多数は小さくなるという特徴があり、パラメータ空間における極めて非等方的な曲率を示している。著者らは平均場理論とランダム行列理論を用いて、これらのスペクトルの解析的表現を導出し、回帰、ソフトマックス出力付き分類、ニューラルトランジットカーネル、特徴空間計量のFIMのあらゆる種別にわたり、この現象が継続することを示した。

ABSTRACT

The Fisher information matrix (FIM) plays an essential role in statistics and machine learning as a Riemannian metric tensor or a component of the Hessian matrix of loss functions. Focusing on the FIM and its variants in deep neural networks (DNNs), we reveal their characteristic scale dependence on the network width, depth and sample size when the network has random weights and is sufficiently wide. This study covers two widely-used FIMs for regression with linear output and for classification with softmax output. Both FIMs asymptotically show pathological eigenvalue spectra in the sense that a small number of eigenvalues become large outliers depending the width or sample size while the others are much smaller. It implies that the local shape of the parameter space or loss landscape is very sharp in a few specific directions while almost flat in the other directions. In particular, the softmax output disperses the outliers and makes a tail of the eigenvalue density spread from the bulk. We also show that pathological spectra appear in other variants of FIMs: one is the neural tangent kernel; another is a metric for the input signal and feature space that arises from feedforward signal propagation. Thus, we provide a unified perspective on the FIM and its variants that will lead to more quantitative understanding of learning in large-scale DNNs.

研究の動機と目的

  • ランダム重みを有する深層ニューラルネットワークにおけるフィッシャー情報計量(FIM)およびその変種のスペクトル的性質を理論的に分析すること。
  • ネットワークの幅、深さ、および訓練サンプルサイズが、回帰および分類設定におけるFIMの固有値分布に与える影響を理解すること。
  • 平均二乗誤差損失に対するFIMの先行研究を、分類の標準的設定であるクロスエントロピーとソフトマックス出力に拡張すること。
  • ニューラルトランジットカーネルや特徴空間計量を含む、複数のFIM変種における病理的スペクトルの統一的理解を図ること。
  • 平均場理論とランダム行列理論を用いた理論的枠組みを提供し、広大なDNNにおける固有値統計を解析的に予測すること。

提案手法

  • 著者らは、広大でランダムに初期化されたDNNにおける勾配および活性化統計を記述する順序パラメータを、平均場理論を用いて導出した。
  • ランダム行列理論を適用し、ネットワーク幅が無限大に近づく際のFIMおよびその変種の漸近的固有値分布を分析した。
  • FIMは、異なる層に対応するブロック行列に分解され、双対行列表現が用いられ、固有値統計が導出された。
  • ソフトマックス出力の場合、FIMは勾配の外積の和として表現され、摂動解析を用いてその主要な固有値行動が導出された。
  • ニューラルトランジットカーネル(NTK)および特徴空間計量は、同一の枠組みを用いて分析され、同一の病理的スペクトル的行動を示した。
  • FIMの平均、2次モーメント、最大固有値に対する解析的表現が、活性化統計および重み分散パラメータの観点から導出された。

実験結果

リサーチクエスチョン

  • RQ1回帰タスクにおける広大でランダムに初期化された深層ニューラルネットワークのFIMの固有値スペクトルは、どのように振る舞うか?
  • RQ2ソフトマックス出力とクロスエントロピー損失を用いた分類ネットワークにおいても、少数の大きな固有値と多数の小さな固有値からなる病理的スペクトル的行動が継続するか?
  • RQ3ネットワークの深さ、幅、および訓練サンプルサイズは、FIMおよびその変種における極端な固有値の出現にどの程度影響を与えるか?
  • RQ4ニューラルトランジットカーネルや特徴空間計量といった他の関連計量に対しても、同様の病理的スペクトルパターンが現れるか?
  • RQ5平均場理論とランダム行列理論を用いた統一的理論的枠組みは、異なるFIM変種におけるスペクトル病理を説明できるか?

主な発見

  • ソフトマックス出力付き分類におけるFIMは、病理的固有値スペクトルを示す:1つの主要固有値がネットワーク幅に従って増大する一方、他の固有値は小さく保たれ、パラメータ空間の曲率における極めて強い非等方性を示している。
  • 最大固有値は $ \lambda_{\text{max}} \sim \tilde{\alpha} \left( \frac{N-1}{N} \tilde{\kappa}_2 + \frac{1}{N} \tilde{\kappa}_1 \right) $ とスケーリングする。ここで $ \tilde{\alpha} $ は幅および活性化統計に依存する。
  • 回帰(MSE損失)におけるFIMの固有値スペクトルに対しても病理的行動が見られ、ネットワーク幅が増大するに従い、漸近的に1つの外れ値固有値が出現する。
  • ニューラルトランジットカーネル(NTK)および信号伝搬に基づく特徴空間計量は、同一の病理的スペクトルパターンを示し、普遍的な現象であることを示唆している。
  • 最大固有値に対応する固有ベクトルは、期待勾配 $ \mathbb{E}[\nabla_h f_k] $ と整合しており、鋭い方向がグローバルパラメータシフトに対応していることを示している。
  • 大多数の固有値はゼロ付近に集中している一方で、外れ値固有値がスペクトルを支配しており、最適化が狭く曲がった部分空間に制限されていることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。