Skip to main content
QUICK REVIEW

[論文レビュー] The Nonlinearity Coefficient - Predicting Overfitting in Deep Neural Networks.

George Philipp, Jaime Carbonell|arXiv (Cornell University)|Jun 1, 2018
Neural Networks and Applications被引用数 8
ひとこと要約

本稿では、勾配の大きさに基づく指標である非線形性係数(NLC)を導入し、深層ニューラルネットワークの関数的複雑性を定量化する。NLCは、テスト誤差および過学習の強力な予測子であり、層間で安定しており、スケーリング、バイアス、幅に対して不変であるため、最適なネットワーク容量を示す最初の信頼できる指標である。

ABSTRACT

For a long time, designing neural architectures that exhibit high performance was considered a dark art that required expert hand-tuning. One of the few well-known guidelines for architecture design is the avoidance of exploding gradients, though even this guideline has remained relatively vague and circumstantial. We introduce the nonlinearity coefficient (NLC), a measurement of the complexity of the function computed by a neural network that is based on the magnitude of the gradient. Via an extensive empirical study, we show that the NLC is a powerful predictor of test error and that attaining a right-sized NLC is essential for optimal performance. The NLC exhibits a range of intriguing and important properties. It is closely tied to the amount of information gained from computing a single network gradient. It is tied to the error incurred when replacing the nonlinearity operations in the network with linear operations. It is not susceptible to the confounders of multiplicative scaling, additive bias and layer width. It is stable from layer to layer. Hence, we argue that the NLC is the first robust predictor of overfitting in deep networks.

研究の動機と目的

  • ヒューリスティックな設計手法を超えて、深層ニューラルネットワークにおける過学習の信頼できる測定可能な指標を同定すること。
  • 勾配の爆発を避けること以外の原則的ガイドラインの欠如に応えること。
  • 深層ネットワークにおける非線形変換の複雑性を定量化する指標を開発すること。
  • 幅、スケーリング、バイアスといった一般的なアーキテクチャ的混同要因に対して不変である、汎化性能の予測子を作成すること。

提案手法

  • 非線形性係数(NLC)は、ネットワーク出力のパラメータに関する勾配の大きさとして計算される。
  • NLCは、非線形性がもたらす関数的複雑性を反映するように、ネットワーク出力がパラメータの変化に対してどれほど感度を示すかを測定する。
  • この手法は、勾配計算ごとに得られる情報量を評価し、NLCを情報理論的要因と結びつける。
  • 線形近似によって生じる誤差を定量化するために、非線形性を有するネットワークとないネットワークとの間でNLCを比較する。
  • 安定性と予測力の評価を目的として、多様なアーキテクチャおよび学習環境で指標を評価する。
  • 画像分類ベンチマークを用いた広範な実験を通じて、実証的妥当性を確認し、テスト誤差と一貫した相関関係を示した。

実験結果

リサーチクエスチョン

  • RQ1アーキテクチャのハイパーパrameterに依存しない、一貫した指標が、深層ニューラルネットワークにおける過学習を予測できるか?
  • RQ2勾配の大きさは、深層ネットワークの情報含量および関数的複雑性とどのように関係するか?
  • RQ3非線形性を線形演算に置き換えると、性能はどの程度劣化するか。その劣化は定量的に測定可能か?
  • RQ4NLCは乗法的スケーリング、加法的バイアス、および層の幅に対して不変であるか。これにより、信頼できる診断ツールとなるか?
  • RQ5適切なサイズのNLCは、最適な汎化性能と相関するか?

主な発見

  • NLCは、多様な深層学習アーキテクチャおよびデータセットにおいて、テスト誤差の強力な予測子である。
  • 最適な中間的なNLC値を示すネットワークが、最小のテスト誤差を達成しており、過学習と不足学習のバランスが取れていることを示している。
  • NLCは層間で安定しており、ネットワーク全体にわたり関数的複雑性の一貫した測定が可能であることを示している。
  • NLCは乗法的スケーリング、加法的バイアス、および層の幅に対して不変であるため、一般的なアーキテクチャ的変動に対して頑健である。
  • 非線形性を線形演算に置き換えると、テスト誤差が有意に増加し、これはNLC値と直接相関している。
  • NLCは勾配計算ごとの情報量の増加を定量化しており、勾配ダイナミクスと汎化能力を結びつける。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。