[论文解读] Analysis of the rate of convergence of an over-parametrized deep neural network estimate learned by gradient descent
该论文分析了通过梯度下降训练的过参数化深度神经网络估计器在非参数回归中的收敛速率。在适当的初始化和梯度下降超参数选择下,它证明了对于 Hölder 光滑度指数 $p \in [1/2,1]$ 的回归函数,期望 $L_2$ 误差的收敛速率接近 $n^{-1/(1+d)}$,并在交互模型中实现了最优的 $d^*$-维收敛速率。
Estimation of a regression function from independent and identically distributed random variables is considered. The $L_2$ error with integration with respect to the design measure is used as an error criterion. Over-parametrized deep neural network estimates are defined where all the weights are learned by the gradient descent. It is shown that the expected $L_2$ error of these estimates converges to zero with the rate close to $n^{-1/(1+d)}$ in case that the regression function is Hölder smooth with Hölder exponent $p \in [1/2,1]$. In case of an interaction model where the regression function is assumed to be a sum of Hölder smooth functions where each of the functions depends only on $d^*$ many of $d$ components of the design variable, it is shown that these estimates achieve the corresponding $d^*$-dimensional rate of convergence.
研究动机与目标
- 理论分析通过梯度下降训练的过参数化深度神经网络的收敛特性,填补现有理论中常忽略过参数化和优化动力学的空白。
- 在现实训练条件下,建立深度神经网络估计器在非参数回归中期望 $L_2$ 风险的收敛速率。
- 证明即使参数数量超过样本大小,通过梯度下降训练的过参数化网络也能实现近似最优的收敛速率。
- 研究此类估计器在回归函数仅依赖于输入中 $d^*$ 个分量的交互模型中,是否能实现 $d^*$-维的收敛速率。
- 通过将随机初始化和梯度下降等现实训练动态纳入收敛速率分析,弥合实际深度学习与理论分析之间的差距。
提出的方法
- 作者定义了一个过参数化深度神经网络估计器,其中所有权重均通过从随机初始化开始的梯度下降学习。
- 通过初始化约束施加权重有界的神经网络类的度量熵界来控制泛化误差。
- 通过引入正则化并控制梯度下降过程中内部权重的变化,分析优化过程,方法是采用有界步长和步数。
- 通过过参数化和网络拓扑控制近似误差,确保以高概率存在一组初始内部权重,使得在外层权重被适当地训练后,能够实现良好近似。
- 理论分析结合度量熵、泰勒近似和分段多项式近似,以界定覆盖数并控制泛化误差。
- 关键技术工具包括对网络函数导数的界以及由权重约束诱导的函数类的覆盖数估计。
实验结果
研究问题
- RQ1通过梯度下降训练的过参数化深度神经网络能否在非参数回归中实现近似最优的收敛速率?
- RQ2当真实回归函数具有 Hölder 光滑度指数 $p \in [1/2,1]$ 时,此类估计器的期望 $L_2$ 误差的收敛速率是多少?
- RQ3在回归函数仅依赖于输入中 $d^*$ 个分量的交互模型中,该估计器是否能实现 $d^*$-维的收敛速率?
- RQ4初始化约束和梯度下降超参数(步长、迭代步数)如何影响泛化和近似特性?
- RQ5能否为在过参数化条件下使用随机或确定性梯度下降训练的深度网络推导出理论收敛保证?
主要发现
- 在 Hölder 光滑度指数 $p \in [1/2,1]$ 的条件下,通过梯度下降训练的过参数化深度神经网络估计器的期望 $L_2$ 误差以 $n^{-1/(1+d) + \epsilon}$ 的速率收敛至零,其中任意 $\epsilon > 0$。
- 在回归函数为 $d^*$-元 Hölder 光滑函数之和的交互模型中,该估计器实现了最优的 $d^*$-维收敛速率 $n^{-2p/(d^*+1)}$。
- 收敛速率近乎最优,趋近于 $n^{-1/(1+d)}$,与 Hölder 光滑度下非参数回归的极小极大速率一致。
- 分析表明,以高概率存在一组随机初始化的内部权重,使得在外层权重被适当地训练后,能够实现良好近似。
- 梯度下降的迭代步数和步长被仔细选择,以防止内部权重发生大幅变化,从而确保稳定性和泛化能力。
- 理论界依赖于有界权重下神经网络函数类的度量熵和覆盖数估计,结合基于泰勒展开的近似论证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。