Skip to main content
QUICK REVIEW

[论文解读] On the Convergence of Gradient Descent Training for Two-layer ReLU-networks in the Mean Field Regime

Stephan Wojtowytsch|arXiv (Cornell University)|May 27, 2020
Neural Networks and Applications参考文献 64被引用 14
一句话总结

该论文在均场框架下,为两层ReLU网络的梯度下降收敛至最小贝叶斯风险建立了必要且充分的条件,表明收敛性仅取决于速度势的弱收敛,而不依赖于初始化。关键结果表明,当速度势局部一致收敛于零时,即使不假设存在极限参数分布,也能收敛至全局最小值。

ABSTRACT

We describe a necessary and sufficient condition for the convergence to minimum Bayes risk when training two-layer ReLU-networks by gradient descent in the mean field regime with omni-directional initial parameter distribution. This article extends recent results of Chizat and Bach to ReLU-activated networks and to the situation in which there are no parameters which exactly achieve MBR. The condition does not depend on the initalization of parameters and concerns only the weak convergence of the realization of the neural network, not its parameter distribution.

研究动机与目标

  • 将Chizat与Bach的均场收敛结果扩展至ReLU激活的两层网络,此类网络不可微,因此先前理论未涵盖。
  • 在不假设存在极限参数分布的前提下,建立收敛至最小贝叶斯风险的结果,仅依赖于速度势极限的唯一性。
  • 通过利用ReLU激活函数作为一阶齐次函数的乘积结构,解决其不可微性问题。
  • 识别出一种与初始化无关的条件,该条件可保证在均场极限下收敛至全局最小值。
  • 分析Morse-Sard条件在确保收敛性中的作用,并表明其在高维(d ≥ 8)下对某些Barron函数会失效。

提出的方法

  • 使用均场近似建模两层ReLU网络,其中参数分布通过种群风险泛函的2-沃瑟斯坦梯度流演化。
  • 将速度势定义为风险相对于参数分布的泛函导数:$ \frac{\delta\mathcal{R}}{\delta\pi}(\pi_t; a,w,b) = \int (\partial_1\ell)(f_{\pi_t}(x),y) \, a\,\sigma(w^T x + b) \, \mathbb{P}(dx \otimes dy) $。
  • 利用ReLU函数的正齐次性与可分解性,将其分解为两个一阶齐次分量,从而避免梯度流中的不可微性问题。
  • 通过证明种群风险收敛至其最小值与速度势局部一致收敛于零之间的等价性,建立收敛至最小贝叶斯风险的结果。
  • 引入一个关于数据分布的技术性Morse-Sard型条件,以确保水平集的正则性,并表明该条件在低维(d=2)下成立,但在d ≥ 8时可能不成立。
  • 利用紧致性与弱收敛论证表明,若速度势局部一致收敛,则风险收敛至最小贝叶斯风险,即使不假设参数分布收敛。

实验结果

研究问题

  • RQ1在均场框架下,两层ReLU网络的梯度下降训练在何种条件下收敛至最小贝叶斯风险?
  • RQ2是否可以在不假设存在极限参数分布的前提下,保证收敛至全局最小值?
  • RQ3ReLU激活的不可微性如何影响Wasserstein梯度流的收敛性?能否通过激活函数的结构特性克服此问题?
  • RQ4Morse-Sard条件在确保收敛性中起什么作用?其有效性如何随输入维度变化?
  • RQ5速度势的收敛是否足以保证收敛至最小贝叶斯风险?其是否依赖于初始化?

主要发现

  • 在Morse-Sard条件下,种群风险 $ \mathcal{R}(\pi_t) $ 收敛至最小贝叶斯风险,当且仅当速度势 $ \frac{\delta\mathcal{R}}{\delta\pi}(\pi_t) $ 沿 $ t \to \infty $ 局部一致收敛于零。
  • 收敛条件与初始化无关,仅依赖于速度势的弱收敛行为。
  • 即使不存在精确达到最小贝叶斯风险的参数分布,该结果依然成立,从而将先前结果推广至更现实的设定。
  • Morse-Sard条件是速度势收敛与风险收敛之间等价性的必要条件;若无该条件,只要速度势收敛于零,等价性仍成立。
  • 对于某些Barron函数,Morse-Sard性质在维度 $ d \geq 8 $ 时会失效,表明该条件并非普遍成立,尽管其在 $ d=2 $ 时成立。
  • 若 $ \pi_t $ 沿2-沃瑟斯坦距离收敛至极限 $ \pi_\infty $,且速度势收敛于零,则 $ \pi_\infty $ 最小化风险泛函 $ \mathcal{R} $。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。