Skip to main content
QUICK REVIEW

[論文レビュー] Deep frequency principle towards understanding why deeper learning is faster

Zhi‐Qin John Xu, Hanxu Zhou|arXiv (Cornell University)|Jul 28, 2020
Stochastic Gradient Optimization Techniques参考文献 35被引用数 5
ひとこと要約

本稿では、深層フィードフォワードニューラルネットワークがなぜより速く学習するのかを説明する「深層周波数原理」を提案する。より深いネットワークは、学習中に有効なターゲット関数を低周波数に偏らせるが、深層ネットワークは低周波数成分を速く学習する(周波数原理に従う)ため、深さが増すことで学習が加速する。CIFAR-10およびMNISTにおける実験的結果は、より深い隠れ層による前処理が、学習データの周波数分布を低周波数側にシフトさせることを裏付け、最適化の高速化を可能にしていることを示している。

ABSTRACT

Understanding the effect of depth in deep learning is a critical problem. In this work, we utilize the Fourier analysis to empirically provide a promising mechanism to understand why feedforward deeper learning is faster. To this end, we separate a deep neural network, trained by normal stochastic gradient descent, into two parts during analysis, i.e., a pre-condition component and a learning component, in which the output of the pre-condition one is the input of the learning one. We use a filtering method to characterize the frequency distribution of a high-dimensional function. Based on experiments of deep networks and real dataset, we propose a deep frequency principle, that is, the effective target function for a deeper hidden layer biases towards lower frequency during the training. Therefore, the learning component effectively learns a lower frequency function if the pre-condition component has more layers. Due to the well-studied frequency principle, i.e., deep neural networks learn lower frequency functions faster, the deep frequency principle provides a reasonable explanation to why deeper learning is faster. We believe these empirical studies would be valuable for future theoretical studies of the effect of depth in deep learning.

研究の動機と目的

  • より高いエポックあたりの計算コストがあるにもかかわらず、なぜ深層ニューラルネットワークが速く学習するのかを理解すること。
  • 深さが、学習中の有効ターゲット関数の周波数構成に影響を与えるかどうかを調査すること。
  • フーリエ解析を用いて、深さ、周波数バイアス、および学習速度の関係を実証的証拠で提示すること。
  • より深い層による前処理が、深層ネットワーク内の後続コンポonentの学習可能性にどのように影響するかを探索すること。
  • 周波数ドメインの視点から、今後の深層学習における深さの効果に関する理論的研究を導くこと。

提案手法

  • ネットワークを、最初の l−1 層からなる前処理部と、残りの層からなる学習部に分解し、前者の出力を後者の入力として用いる。
  • 高次元関数の周波数分布、特に変換された学習データ S^{[l−1]} の特徴を特定するためにフィルタリング手法を用いる。
  • CIFAR-10およびMNISTデータセットを用い、ResNet18の変種および深さを変化させた全結合ネットワークで実験を実施する。
  • さまざまな学習エポックにおける有効ターゲット関数 S^{[l−1]} の周波数成分を、半径分布関数(RDFs)を用いて分析する。
  • 異なる数の前処理層を有するネットワーク間で、学習速度と周波数バイアスを比較分析する。
  • 非常に深いネットワークにおける消失勾配の影響を軽減するために残差接続を用い、より深い領域でも原理の妥当性を検証可能とする。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークの深さを増すことで、学習部が見ることになる有効ターゲット関数に低周波数バイアスが生じるか?
  • RQ2変換された入力 S^{[l−1]} の周波数構成が、学習部の学習速度にどの程度影響を与えるか?
  • RQ3パリティ関数のような高周波数タスクを含め、さまざまなネットワークアーキテクチャおよびデータセットにおいて、深層周波数原理はどのように成立するか?
  • RQ4非常に深いネットワークにおける深さ、周波数バイアス、および消失勾配問題の関係は何か?
  • RQ5残差接続は、極めて深いネットワークにおいて深層周波数原理を保持できるか。もしそうならば、どのような条件下で成立するか?

主な発見

  • より深い前処理部は、半径分布関数(RDFs)による確認により、有効な学習データ S^{[l−1]} の周波数分布を低周波数側にシフトさせる。
  • 有効ターゲット関数が低周波数で支配されている場合、学習部はより速く学習する。これは、低周波数関数が速く学習できるという広く知られた周波数原理と整合的である。
  • パリティ関数のような高周波数ターゲット関数を学習する場合でも、深層周波数原理は成立し、より深い層に低周波数表現への一般バイアスがあることを示している。
  • 残差接続のない非常に深い全結合ネットワーク(例:80層)では、周波数バイアスが崩れ、消失勾配のため学習が遅くなる。これは深層周波数原理に反する。
  • 残差接続がある場合、極めて深いネットワークでも深層周波数原理が保持され、深さにかかわらず学習速度がほぼ同等に保たれる。これは、深さがもはや学習を加速しなくなる「飽和効果」を示している。
  • 深さが増すにつれて、S^{[l−1]} の周波数分布はますます非常に低い周波数に支配されるようになり、深い隠れ層では低周波数表現への収束が見られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。