Skip to main content
QUICK REVIEW

[论文解读] Deep frequency principle towards understanding why deeper learning is faster

Zhi‐Qin John Xu, Hanxu Zhou|arXiv (Cornell University)|Jul 28, 2020
Stochastic Gradient Optimization Techniques参考文献 35被引用 5
一句话总结

本文提出了深度频率原理,解释了为何更深的前馈神经网络训练速度更快:更深的网络在训练过程中使有效目标函数偏向低频,而深度网络能更快学习低频分量(依据频率原理),因此增加深度可加速学习。在CIFAR-10和MNIST上的实证结果验证了通过更深的隐藏层进行预处理,可使训练数据的频率分布向低频偏移,从而实现更快的优化。

ABSTRACT

Understanding the effect of depth in deep learning is a critical problem. In this work, we utilize the Fourier analysis to empirically provide a promising mechanism to understand why feedforward deeper learning is faster. To this end, we separate a deep neural network, trained by normal stochastic gradient descent, into two parts during analysis, i.e., a pre-condition component and a learning component, in which the output of the pre-condition one is the input of the learning one. We use a filtering method to characterize the frequency distribution of a high-dimensional function. Based on experiments of deep networks and real dataset, we propose a deep frequency principle, that is, the effective target function for a deeper hidden layer biases towards lower frequency during the training. Therefore, the learning component effectively learns a lower frequency function if the pre-condition component has more layers. Due to the well-studied frequency principle, i.e., deep neural networks learn lower frequency functions faster, the deep frequency principle provides a reasonable explanation to why deeper learning is faster. We believe these empirical studies would be valuable for future theoretical studies of the effect of depth in deep learning.

研究动机与目标

  • 理解为何更深的神经网络尽管每轮计算成本更高,但训练速度反而更快。
  • 研究深度是否会影响训练过程中有效目标函数的频率组成。
  • 通过傅里叶分析提供深度、频率偏差与训练速度之间关联的实证证据。
  • 探讨更深的层作为预处理模块,如何影响深层网络中后续组件的可学习性。
  • 通过频域视角,为未来关于深度学习中深度效应的理论研究提供指导。

提出的方法

  • 将网络分解为预处理组件(前l−1层)和学习组件(剩余层),前者输出作为后者输入。
  • 采用滤波方法表征高维函数的频率分布,特别是变换后的训练数据S^{[l−1]}的频率分布。
  • 在ResNet18变体和不同深度的全连接网络上进行实验,使用CIFAR-10和MNIST数据集。
  • 通过径向分布函数(RDFs)分析不同训练轮次下有效目标函数S^{[l−1]}的频率成分。
  • 比较具有不同预处理层数的网络在训练速度和频率偏差方面的差异。
  • 使用残差连接以缓解极深网络中的梯度消失问题,从而在更深的网络中验证该原理。

实验结果

研究问题

  • RQ1在深层神经网络中增加深度是否会导致学习组件所见的有效目标函数出现更低频的偏差?
  • RQ2变换后输入S^{[l−1]}的频率组成在多大程度上影响了学习组件的训练速度?
  • RQ3该深度频率原理在不同网络架构和数据集(包括高频率任务如奇偶校验函数)中是否依然成立?
  • RQ4在极深网络中,深度、频率偏差与梯度消失问题之间存在何种关系?
  • RQ5残差连接是否能在极深网络中保持深度频率原理?若能,其成立条件是什么?

主要发现

  • 更深的预处理组件使有效训练数据S^{[l−1]}的频率分布向低频偏移,该结论由径向分布函数(RDFs)确认。
  • 当有效目标函数以低频分量为主时,学习组件训练速度更快,这与已知的频率原理一致——低频函数更容易被快速学习。
  • 即使在学习高频频目标函数(如奇偶校验函数)时,深度频率原理依然成立,表明深层网络中普遍存在对低频表示的普遍偏差。
  • 在无残差连接的极深全连接网络(如80层)中,频率偏差失效,训练速度因梯度消失而变慢,违反了深度频率原理。
  • 在使用残差连接的情况下,即使在极深网络中,深度频率原理依然保持,且不同深度下的训练速度保持相近,表明存在一种饱和效应,即深度不再进一步加速学习。
  • 随着深度增加,S^{[l−1]}的频率分布越来越被极低频分量主导,表明深层隐藏层趋于收敛到低频表示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。