Skip to main content
QUICK REVIEW

[論文レビュー] On the infinite width limit of neural networks with a standard parameterization

Jascha Sohl‐Dickstein, Roman Novak|arXiv (Cornell University)|Jan 21, 2020
Stochastic Gradient Optimization Techniques参考文献 26被引用数 14
ひとこと要約

本稿では、学習率スケーリングを一貫させ、相対的な層幅効果を保持し、幅が無限大に近づく際の安定した勾配フローを確保する、ニューラルネットワークの改善された標準パラメータ化を提案する。NTK やナード標準パラメータ化とは異なり、この手法は発散しない well-defined なニューラル接線カーネルをもたらし、有限幅の学習ダイナミクスとよりよく一致し、実験でも同等または優れた性能を達成する。

ABSTRACT

There are currently two parameterizations used to derive fixed kernels corresponding to infinite width neural networks, the NTK (Neural Tangent Kernel) parameterization and the naive standard parameterization. However, the extrapolation of both of these parameterizations to infinite width is problematic. The standard parameterization leads to a divergent neural tangent kernel while the NTK parameterization fails to capture crucial aspects of finite width networks such as: the dependence of training dynamics on relative layer widths, the relative training dynamics of weights and biases, and overall learning rate scale. Here we propose an improved extrapolation of the standard parameterization that preserves all of these properties as width is taken to infinity and yields a well-defined neural tangent kernel. We show experimentally that the resulting kernels typically achieve similar accuracy to those resulting from an NTK parameterization, but with better correspondence to the parameterization of typical finite width networks. Additionally, with careful tuning of width parameters, the improved standard parameterization kernels can outperform those stemming from an NTK parameterization. We release code implementing this improved standard parameterization as part of the Neural Tangents library at https://github.com/google/neural-tangents.

研究の動機と目的

  • 有限幅における学習ダイナミクスの主要な特徴を保持できない、既存の無限幅ニューラルネットワークパラメータ化の不整合を解消すること。
  • 幅が増加する際、ナード標準パラメータ化で発生する発散するニューラル接線カーネルの問題を解消すること。
  • 実際の学習実務と整合する、有限で安定した学習率スケールを無限幅極限でも維持すること。
  • NTK パラメータ化とは異なり、重みとバイアスの相対的な学習ダイナミクスが保持されることを保証すること。
  • well-defined なニューラル接線カーネルをもたらすと同時に、通常の有限幅ネットワークの挙動と密接に一致するパラメータ化を開発すること。

提案手法

  • 幅スケーリング要因 $ s $ を導入し、各層の幅を $ n^l = sN^l $ と定義し、無限幅極限では $ s \to \infty $ とする。
  • アフィン層を $ z^{l+1} = \frac{1}{\sqrt{s}} W^l y^l + b^l $ として再定式化し、分散スケーリングを維持する。
  • $ b^l \sim \mathcal{N}(0, \sigma_b^2) $ を用いることで、無限幅極限においてもバイアスの寄与が一定に保たれるようにする。
  • このパラメータ化から無限幅における NNGP および NTK カーネルを導出し、well-defined な形に収束することを示す。
  • モンテカルロシミュレーションを用いてカーネルの挙動を検証し、Neural Tangents ライブラリへの統合を実施する。
  • 一般化性能を最適化するために層幅 $ N^l $ をチューニングし、特定の設定において NTK カーネルよりも優れた性能を示す。

実験結果

リサーチクエスチョン

  • RQ1ナード標準パラメータ化と同様に、発散するニューラル接線カーネルや有限幅の学習ダイナミクスの喪失を伴わずに、無限幅に拡張可能な標準パラメータ化は可能か?
  • RQ2改善された標準パラメータ化は、無限幅極限において層幅の相対的影響が保持されるか?
  • RQ3幅パラメータを丁寧にチューニングした場合、改善された標準パラメータ化は NTK パラメータ化よりも一般化性能が優れているか?
  • RQ4無限幅における重みとバイアスの学習ダイナミクスは、改善された標準パラメータ化と NTK パラメータ化とでどのように異なるか?
  • RQ5改善された標準パラメータ化は、有限幅ネットワークの実際の学習をよりよく反映するニューラル接線カーネルをもたらすか?

主な発見

  • 改善された標準パラメータ化は、ナード標準パラメータ化とは異なり、発散しない well-defined なニューラル接線カーネルをもたらす。
  • 得られたカーネルは、全結合 ReLU ネットワークにおいて NTK パラメータ化と同等のテスト精度を達成する。
  • 層幅 $ N^l $ を丁寧にチューニングすることで、改善された標準パラメータ化は全結合ネットワークにおいて NTK パラメータ化を上回る一般化性能を示す。
  • 改善されたパラメータ化は、幅が増加する際の層幅の相対的影響を保持するが、これは NTK パラメータ化では失われる。
  • 重みとバイアスの相対的学習ダイナミクスが保持されるが、NTK パラメータ化ではバイアスが過剰に強調される。
  • バイアスのニューラル接線カーネル寄与は幅が増加しても一定に保たれるが、重みの寄与は $ N^l $ に比例して増加するため、広いネットワークではバイアスの影響が相対的に小さくなる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。