[论文解读] Nonparametric regression using over-parameterized shallow ReLU neural networks
该论文表明,通过权重约束的过参数化浅层 ReLU 神经网络可在 Hölder 空间与变分函数空间上的非参数回归中实现极小极大最优收敛速率。通过利用局部 Rademacher 复杂度与基于范数的正则化,作者建立了 Hölder 光滑度 $ \alpha < (d+3)/2 $ 下的最优收敛速率 $ n^{-2\alpha/(d+2\alpha)} $,其与已知的极小极大下界仅相差对数因子。
It is shown that over-parameterized neural networks can achieve minimax optimal rates of convergence (up to logarithmic factors) for learning functions from certain smooth function classes, if the weights are suitably constrained or regularized. Specifically, we consider the nonparametric regression of estimating an unknown $d$-variate function by using shallow ReLU neural networks. It is assumed that the regression function is from the Hölder space with smoothness $α<(d+3)/2$ or a variation space corresponding to shallow neural networks, which can be viewed as an infinitely wide neural network. In this setting, we prove that least squares estimators based on shallow neural networks with certain norm constraints on the weights are minimax optimal, if the network width is sufficiently large. As a byproduct, we derive a new size-independent bound for the local Rademacher complexity of shallow ReLU neural networks, which may be of independent interest.
研究动机与目标
- 通过研究过参数化浅层 ReLU 网络在非参数回归中的表现,弥合理论分析与实际深度学习之间的差距。
- 证明在宽、过参数化的网络上使用约束最小二乘估计器可实现极小极大最优收敛速率。
- 通过权重范数而非网络规模,分析近似误差与泛化误差之间的权衡。
- 推导出浅层 ReLU 网络局部 Rademacher 复杂度的全新尺寸无关界,该结果具有独立的理论意义。
提出的方法
- 采用约束最小二乘估计器,利用范数 $ \kappa(\theta) = \sum_{i=1}^N |a_i| \|w_i\|_2 \leq M $ 对过参数化浅层 ReLU 网络进行正则化。
- 应用局部化技术以控制函数类的局部 Rademacher 复杂度,从而提升泛化误差的控制能力。
- 采用链式论证与对称化方法,控制约束参数空间上的经验过程。
- 推导出浅层 ReLU 网络局部 Rademacher 复杂度的全新尺寸无关界,这对于处理无限宽情形至关重要。
- 利用星-熵积分与度量熵,以权重范数为度量控制函数类的复杂度。
- 将误差分解为近似误差与估计误差,后者通过局部复杂度界加以控制。
实验结果
研究问题
- RQ1过参数化浅层 ReLU 神经网络是否可在非参数回归中实现极小极大最优收敛速率?
- RQ2通过权重范数 $ \kappa(\theta) \leq M $ 进行正则化,是否可在过参数化设置下实现最优泛化?
- RQ3能否为浅层 ReLU 网络推导出一个尺寸无关的局部 Rademacher 复杂度界,以支持理论分析?
- RQ4在权重约束下,Hölder 空间 $ \mathcal{H}^\alpha $ 与变分空间 $ \mathcal{F}_\sigma(1) $ 中回归函数的最优收敛速率为何?
- RQ5与基于覆盖数或 VC 维的常规方法相比,局部化技术如何提升泛化误差界?
主要发现
- 使用浅层 ReLU 网络的约束最小二乘估计器在 Hölder 空间 $ \mathcal{H}^\alpha $ 中实现了极小极大最优收敛速率 $ n^{-2\alpha/(d+2\alpha)} $,其中 $ \alpha < (d+3)/2 $。
- 对于变分空间 $ \mathcal{F}_\sigma(1) $,该方法实现了极小极大最优收敛速率 $ n^{-(d+3)/(2d+3)} $,与已知下界一致。
- 推导出浅层 ReLU 网络局部 Rademacher 复杂度的全新尺寸无关界,该界与网络宽度无关,对过参数化分析至关重要。
- 通过在复杂度估计中引入局部化技术,实现了对先前工作的速率改进,替代了依赖网络规模的旧有界。
- 分析表明,泛化误差可通过权重范数控制,而非网络深度或宽度,这支持了宽、过参数化网络在实践中的成功。
- 该结果在假设网络宽度 $ N $ 足够大时成立,以确保函数类足够丰富,能良好逼近目标函数。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。