Skip to main content
QUICK REVIEW

[論文レビュー] Asymptotics of Wide Convolutional Neural Networks

Anders Andreassen, Ethan Dyer|arXiv (Cornell University)|Aug 19, 2020
Stochastic Gradient Optimization Techniques参考文献 34被引用数 14
ひとこと要約

この論文は、広範な畳み込みニューラルネットワーク(CNN)におけるスケーリング法則を導出する図式的フレームワークを開発する。有限幅CNNは、幅が有限であるための補正項が 𝒪(n⁻¹) に従って減少することにより、実際には無限幅の対応物を上回ることが示された。著者らは、有限幅と無限幅モデル間のテスト損失の差が 𝒪(n⁻¹) に比例することを確立し、これは有限幅ネットワークが最適化の詳細に応じて一般化性能が優れるか劣る場合があるという経験的観察と整合的である。

ABSTRACT

Wide neural networks have proven to be a rich class of architectures for both theory and practice. Motivated by the observation that finite width convolutional networks appear to outperform infinite width networks, we study scaling laws for wide CNNs and networks with skip connections. Following the approach of (Dyer & Gur-Ari, 2019), we present a simple diagrammatic recipe to derive the asymptotic width dependence for many quantities of interest. These scaling relationships provide a solvable description for the training dynamics of wide convolutional networks. We test these relations across a broad range of architectures. In particular, we find that the difference in performance between finite and infinite width models vanishes at a definite rate with respect to model width. Nonetheless, this relation is consistent with finite width models generalizing either better or worse than their infinite width counterparts, and we provide examples where the relative performance depends on the optimization details.

研究の動機と目的

  • 無限幅モデルが解析的に取り扱いやすいにもかかわらず、有限幅畳み込みニューラルネットワーク(CNN)がしばしばそれらの無限幅対応物を上回る理由を理解すること。
  • スキップ接続およびプーリング層を有する畳み込みアーキテクチャに、無限幅ニューラル接続核(NTK)形式を拡張すること。
  • 図式的手法を用いて、広範なCNNにおける相関関数の一般スケーリング法則を導出すること。
  • 幅に依存する補正項を用いて、有限幅CNNが無限幅極限に収束する速度を定量化すること。
  • 深く非線形なCNNにおいて、損失およびNTK分散の予測された 𝒪(n⁻¹) スケーリングを実証的に検証すること。

提案手法

  • 完全結合ネットワークの先行研究を拡張し、Feynman規則に基づく一般化された図式的手法を提案して、広範なCNNにおける相関関数を計算する。
  • 畳み込み層、スキップ接続、全結合層、およびグローバル平均プーリング層を有するCNNにおける相関関数のスケーリング仮説を導入する。
  • この仮説を用いて、NTKおよび線形化された学習ダイナミクスに対する有限幅補正を評価する。
  • 形式的枠組みを用いて、トレーニング中のNTKおよび損失の期待的変化を計算し、補正項が 𝒪(n⁻¹) に比例することを示す。
  • CIFAR-10およびMNISTのサブセットを用い、幅を変化させた場合の損失差およびNTK分散の 𝒪(n⁻¹) スケーリングを実証的に検証する。
  • 重み初期化およびモーメント計算を用いて、深く線形なCNNにおけるNTK分散の 𝒪(n⁻¹) スケーリングを証明する。

実験結果

リサーチクエスチョン

  • RQ1畳み込みニューラルネットワークにおける有限幅補正は、ネットワーク幅にどのように依存するか?
  • RQ2無限幅モデルが解析的に単純であるにもかかわらず、有限幅CNNが時としてそれらを上回る理由は何か?
  • RQ3スキップ接続およびプーリング層を有する広範なCNNの漸近的挙動を記述する統一された図式的フレームワークは可能か?
  • RQ4有限幅CNNがテスト損失およびNTKの進化に関して、無限幅極限に収束する速度は何か?
  • RQ5有限幅モデルと無限幅モデルの相対的性能は、停止基準などの最適化ハイパーパrameterに依存するか?

主な発見

  • 有限幅と無限幅CNN間のテスト損失の差が 𝒪(n⁻¹) に比例することを確認し、普遍的な収束速度を裏付けた。
  • CIFAR-10およびMNISTにおける実験結果から、予測された 𝒪(n⁻¹) スケーリングが、多様なアーキテクチャおよび活性化関数において損失差を正確に記述していることが示された。
  • 畳み込み層、スキップ接続、およびグローバル平均プーリング層を有する深く線形なCNNにおいて、ニューラル接続核(NTK)の分散が 𝒪(n⁻¹) に比例することを証明した。
  • 1層の非線形CNNにおいても、重みモーメントの期待値を直接計算することで、NTK分散が 𝒪(n⁻¹) に比例することを示した。
  • 有限幅CNNは、トレーニングハイパーパrameterに応じて、無限幅モデルを上回ることも、下回ることもあるが、これは 𝒪(n⁻¹) 補正モデルと整合的である。
  • 提案された図式的手法により、無限幅形式が畳み込みアーキテクチャに体系的に一般化され、有限幅効果の分析が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。