Skip to main content
QUICK REVIEW

[論文レビュー] Revisiting Natural Gradient for Deep Networks

Razvan Pascanu, Yoshua Bengio|arXiv (Cornell University)|Jan 16, 2013
Stochastic Gradient Optimization Techniques被引用数 121
ひとこと要約

本稿は、深層ネットワークにおける自然勾配降下(NGD)を再考し、ヘシアンフリーモデルとクリロフ部分空間降下法とを関連付ける。フィッシャー情報行列の逆行列をとくために、対角近似を用いるのではなく、切り捨てニュートン法を提案する。主な貢献は、より正確な2次情報に基づいたNGDの変種であり、収束性と一般化性能が向上し、特にラベルなしデータを用いる場合や、学習データの順序に強く、優れた性能を示す。

ABSTRACT

We evaluate natural gradient, an algorithm originally proposed in Amari (1997), for learning deep models. The contributions of this paper are as follows. We show the connection between natural gradient and three other recently proposed methods for training deep models: Hessian-Free (Martens, 2010), Krylov Subspace Descent (Vinyals and Povey, 2012) and TONGA (Le Roux et al., 2008). We describe how one can use unlabeled data to improve the generalization error obtained by natural gradient and empirically evaluate the robustness of the algorithm to the ordering of the training set compared to stochastic gradient descent. Finally we extend natural gradient to incorporate second order information alongside the manifold information and provide a benchmark of the new algorithm using a truncated Newton approach for inverting the metric matrix instead of using a diagonal approximation of it.

研究の動機と目的

  • 深層学習の文脈において、自然勾配降下(NGD)を再評価し、特に2次最適化手法との関連を明らかにすること。
  • フィッシャー情報行列の逆行列をとくために、切り捨てニュートン法を用いることでNGDを改善し、完全な2次情報を取り入れること。
  • ラベルなしデータを用いてNGDの一般化性能を向上させることを調査すること。
  • SGDと比較してNGDの学習データ順序へのロバスト性を実験的に評価すること。
  • メモリ使用量を削減しつつ、クリロフ部分空間技術を用いた共役勾配的更新をNGDに拡張すること。

提案手法

  • ヘシアンの拡張ガウス・ニュートン近似を用いて、NGD、ヘシアンフリーオプティマイゼーション、クリロフ部分空間降下法の理論的関連性を確立する。
  • 対角近似や帯状近似を避けるために、完全なフィッシャー情報行列の逆行列をとる切り捨てニュートン法を提案する。
  • メトリックの逆行列を求めるために線形共役勾配法を用いる多様体共役勾配法を導入し、クリロフ部分空間法と比較してメモリ使用量を削減する。
  • 前向きおよび後ろ向きパスを用いて、効率的なヘシアン・ベクトル積およびヤコビアン・ベクトル積を自動微分により計算する。
  • 勾配とメトリック推定に異なるミニバッチを用いることで、自然勾配方向のノイズを低減する。
  • 小さなミニバッチで勾配とメトリックを推定する際の更新を安定化させるために、ラインサーチとダミングを適用する。

実験結果

リサーチクエスチョン

  • RQ1拡張ガウス・ニュートン近似を通じて、自然勾配降下、ヘシアンフリーオプティマイゼーション、クリロフ部分空間降下法はどのように関連しているか?
  • RQ2フィッシャー行列の逆行列に切り捨てニュートン法を用いることで、NGDの収束性と一般化性能が向上するか?
  • RQ3メトリック推定にラベルなしデータを組み込むことで、NGDの一般化誤差が改善するか?
  • RQ4NGDはSGDよりも学習データの順序にロバストであるか?
  • RQ5パラメータ多様体上で共役勾配法を用いることで、標準的なNGDを上回る性能が得られ、かつメモリ使用量を削減できるか?

主な発見

  • 切り捨てニュートン法を用いた提案されたNGDの変種は、対角近似を用いた標準的なNGDよりも収束が速い。
  • フィッシャー情報行列の推定にラベルなしデータを組み込むことで、一般化誤差が低減し、とくにメトリックが正確な場合に顕著である。
  • 実験的に、NGDはSGDよりもデータ順序にロバストであることが示され、非定常学習の状況下での利点が示唆される。
  • 勾配とメトリックを別々のデータで推定する場合、ダミングと学習率を適切に制御することで、小さなミニバッチでも安定して性能を発揮する。
  • 共役勾配ステップにおける学習率と方向のためのラインサーチを用いることで、固定値またはポラク・リビエールベースの更新よりも性能が向上する。
  • クリロフ部分空間降下法(KSD)とNGDの関連性が裏付けられ、提案手法はKSDと同等の収束速度を達成しつつ、より低いメモリ使用量を実現している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。