[论文解读] Can Shallow Neural Networks Beat the Curse of Dimensionality? A mean field training perspective
本文证明,在均场训练下,两层ReLU神经网络在逼近一般Lipschitz连续目标函数时无法克服维度灾难,因为总体风险的衰减速率不超过 $ t^{-4/(d-2)} $。该结论即使在无限宽网络下依然成立,且表明除非目标函数属于Barron空间,否则在高维情况下收敛速度会显著减慢。
We prove that the gradient descent training of a two-layer neural network on empirical or population risk may not decrease population risk at an order faster than $t^{-4/(d-2)}$ under mean field scaling. Thus gradient descent training for fitting reasonably smooth, but truly high-dimensional data may be subject to the curse of dimensionality. We present numerical evidence that gradient descent training with general Lipschitz target functions becomes slower and slower as the dimension increases, but converges at approximately the same rate in all dimensions when the target function lies in the natural function space for two-layer ReLU networks.
研究动机与目标
- 研究浅层神经网络在均场训练动力学下是否能克服高维函数逼近中的维度灾难。
- 分析两层ReLU网络在高维下对总体风险和经验风险的梯度流收敛速率。
- 识别梯度下降训练保持高效性的条件,特别是与目标函数所在函数空间的关系。
- 阐明Barron空间在实现快速收敛并避免高维设置下衰减速率变慢中的作用。
提出的方法
- 分析在均场缩放下,对总体风险泛函 $ \mathcal{R}(\Theta) = \frac{1}{2}\int_{[0,1]^d} (f_\Theta - f^*)^2 \, dx $ 的梯度流动力学。
- 采用均场缩放,使网络输出为 $ f_\Theta(x) = \frac{1}{m}\sum_{i=1}^m a_i \sigma(w_i^T x + b_i) $,从而在参数空间中实现连续粒子动力学。
- 构造一个Lipschitz连续但不属于Barron空间的目标函数 $ f^* $,表明在高维下收敛速度缓慢。
- 推导出总体风险衰减速率的下界:$ \mathcal{R}(\Theta_t) \geq t^{-4/(d-2)} $,证明对于此类函数不可能存在更快的衰减速率。
- 利用路径范数分析和弱收敛论证,表明参数演化径向分量的增长缓慢,从而限制了收敛速度。
- 通过在经验风险和总体风险上进行数值验证,比较不同维度和目标函数类别下的衰减速率,以验证结果。
实验结果
研究问题
- RQ1通过均场梯度下降训练的两层神经网络能否避免对一般Lipschitz连续目标函数的维度灾难?
- RQ2在高维设置下,浅层ReLU网络的梯度流收敛速率存在何种根本限制?
- RQ3目标函数的函数空间——特别是其是否属于Barron空间——如何影响高维下的训练速度?
- RQ4在高维设置下,经验风险的衰减速率是否快于总体风险?在何种条件下成立?
- RQ5高维下收敛缓慢是否可归因于神经网络函数空间中缺乏最小化器?
主要发现
- 对于任何不属于Barron空间的Lipschitz连续目标函数,总体风险的衰减速率不会快于 $ t^{-4/(d-2)} $,表明在高维下存在根本性减速。
- 随着维度 $ d $ 增加,收敛速率变得任意缓慢,其中 $ \gamma = 4/(d-2) \to 0 $ 当 $ d \to \infty $,证实了维度灾难的存在。
- 当目标函数属于Barron空间时,经验风险和总体风险均以约 $ t^{-1.5} $ 的速率衰减,该速率更快且在不同维度下保持相对稳定。
- 数值实验表明,对于非Barron类目标函数,在高维(如 $ d=250 $)下使用4,000个样本时,经验风险衰减迅速,但总体风险因分布不匹配和参数数量增加而上升。
- 从初始的‘径向’阶段(参数范数快速增长)向稳定‘角向’阶段(仅方向更新)的转变大约发生在 $ t \approx 7 $,标志着训练动力学的转变。
- 训练过程中路径范数增长缓慢,这限制了网络对Barron空间外复杂高维目标函数的适应能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。