Skip to main content
QUICK REVIEW

[论文解读] On the rate of convergence of a neural network regression estimate learned by gradient descent

Alina Braun, Michael Köhler|arXiv (Cornell University)|Dec 9, 2019
Neural Networks and Applications参考文献 36被引用 6
一句话总结

本文首次建立了在实践中通过梯度下降训练的神经网络回归估计的理论收敛速率,表明对单隐藏层网络重复进行随机重启的梯度下降方法可在投影追踪模型中实现最优收敛速率(最多相差对数因子)。该方法结合随机初始化与迭代优化,以克服局部极小值并达到近似最优性能。

ABSTRACT

Nonparametric regression with random design is considered. Estimates are defined by minimzing a penalized empirical $L_2$ risk over a suitably chosen class of neural networks with one hidden layer via gradient descent. Here, the gradient descent procedure is repeated several times with randomly chosen starting values for the weights, and from the list of constructed estimates the one with the minimal empirical $L_2$ risk is chosen. Under the assumption that the number of randomly chosen starting values and the number of steps for gradient descent are sufficiently large it is shown that the resulting estimate achieves (up to a logarithmic factor) the optimal rate of convergence in a projection pursuit model. The final sample size performance of the estimates is illustrated by using simulated data.

研究动机与目标

  • 弥合理论上最优的神经网络估计与实际应用之间的差距,后者使用梯度下降而非全局优化。
  • 分析通过梯度下降结合多次随机初始化最小化经验风险所定义的实际神经网络回归估计器的收敛行为。
  • 证明此类实际估计器可在投影追踪模型下实现非参数回归的最优收敛速率。
  • 为一种紧密模拟深度学习实际训练过程的方法提供理论保证。

提出的方法

  • 该估计器被定义为在一类网络中通过梯度下降最小化经验 $L_2$ 风险的单隐藏层神经网络。
  • 梯度下降过程在独立且均匀随机初始化网络权重的情况下重复多次。
  • 从所有结果估计中,选择经验 $L_2$ 风险最小的一个作为最终估计器。
  • 理论分析利用投影追踪结构,假设真实回归函数是输入线性投影的平滑函数之和。
  • 通过浓度不等式和ReLU网络的逼近误差界(特别是分段多项式逼近)推导收敛速率,
  • 分析同时考虑了优化误差(来自梯度下降)和统计估计误差,对 $L_2$ 风险给出了高概率界。

实验结果

研究问题

  • RQ1通过梯度下降结合随机重启训练的神经网络回归估计器是否可在非参数回归中实现最优收敛速率?
  • RQ2在梯度下降中使用多次随机初始化是否能有效降低陷入较差局部极小值的风险?
  • RQ3在现实训练条件下,基于梯度下降的神经网络估计器在投影追踪模型中的理论收敛速率是多少?
  • RQ4随机重启次数和梯度下降步数如何影响最终估计精度和收敛速率?
  • RQ5随机初始化与迭代优化的结合能否实现接近最小最大最优速率的收敛速率?

主要发现

  • 所提出的估计器在投影追踪模型中实现了非参数回归的最优收敛速率,最多相差对数因子。
  • 收敛速率为 $O\bigl(\bigl(\frac{(\text{log } n)^3}{n}\bigr)^{2p/(2p+1)}\bigr)$,与最小最大最优速率一致,仅相差对数项。
  • 当随机重启次数 $I_n$ 和梯度下降步数足够大时可达到该速率,具体为 $I_n = \text{poly}(\text{log } n)$。
  • 使用有限宽度ReLU网络带来的逼近误差被控制在 $O(1/K^p)$ 以内,其中 $K$ 为隐藏层神经元数量。
  • 在 $t$-邻域内未能逼近真实投影方向 $\boldsymbol{c}_s$ 的概率被控制在 $\exp(-I_n t^{rd/2p})$ 以内,确保了真实结构的高概率恢复。
  • 最终的 $L_2$ 风险界结合了统计估计误差、优化误差和逼近误差,所有误差项均通过高概率浓度不等式得到控制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。