[论文解读] Learning ReLU Networks via Alternating Minimization
本文提出一种用于训练ReLU神经网络的交替最小化算法,通过在估计ReLU激活模式和求解最小二乘问题以更新权重之间交替进行。该方法首次为1层隐藏层ReLU网络以及带有跳跃连接的ResNet型架构提供了可证明的线性收敛保证,仅需O(dk² poly(log d))组样本,且无需除训练轮数外的超参数调优。
We propose and analyze a new family of algorithms for training neural networks with ReLU activations. Our algorithms are based on the technique of alternating minimization: estimating the activation patterns of each ReLU for all given samples, interleaved with weight updates via a least-squares step. The main focus of our paper are 1-hidden layer networks with $k$ hidden neurons and ReLU activation. We show that under standard distributional assumptions on the $d-$dimensional input data, our algorithm provably recovers the true `ground truth' parameters in a linearly convergent fashion. This holds as long as the weights are sufficiently well initialized; furthermore, our method requires only $n=\widetilde{O}(dk^2)$ samples. We also analyze the special case of 1-hidden layer networks with skipped connections, commonly used in ResNet-type architectures, and propose a novel initialization strategy for the same. For ReLU based ResNet type networks, we provide the first linear convergence guarantee with an end-to-end algorithm. We also extend this framework to deeper networks and empirically demonstrate its convergence to a global minimum.
研究动机与目标
- 开发一种新型训练ReLU网络的算法框架,避免梯度下降中常见的超参数调优问题。
- 在标准分布假设下,为1层隐藏层ReLU网络提供可证明的收敛保证。
- 将该框架扩展至具有跳跃连接的残差网络(ResNets),并提出一种新颖的初始化策略。
- 在更深网络上对方法进行实验验证,展示其收敛至全局最小值的能力。
提出的方法
- 该算法在固定所有样本的ReLU激活模式(签名)的同时,交替求解最小二乘问题以更新网络权重。
- 对于每个样本,基于当前的权重估计值,估计每个ReLU神经元的激活状态(开启/关闭)。
- 权重更新步骤通过使用当前激活模式求解线性方程组来完成,将网络视为分段线性模型。
- 该方法采用一种‘线性化技巧’,在每个激活模式区域将ReLU网络视为线性模型。
- 对于ResNet型网络,算法采用恒等初始化,从而在无需复杂基于张量分解的初始化策略的情况下实现收敛。
- 通过逐层应用交替最小化,将该框架扩展至更深网络,实验验证表明其可收敛至零训练损失。
实验结果
研究问题
- RQ1交替最小化能否在可证明的样本复杂度下实现1层隐藏层ReLU网络训练的线性收敛?
- RQ2所提出的方法在成功率方面是否优于标准梯度下降,尤其是在复杂架构中?
- RQ3像恒等初始化这样简单的初始化策略是否能确保ReLU激活的ResNet型架构收敛?
- RQ4该算法恢复真实网络参数所需的样本复杂度是多少?
- RQ5交替最小化框架能否扩展至更深的ReLU网络并取得实验上的成功?
主要发现
- 在标准假设下,该算法实现线性收敛,可在O(log 1/ε)次训练轮数内将参数估计误差降低至ε。
- 对于1层隐藏层网络,该方法需要n = eO(dk²)组样本,实际中为O(dk² poly(log d))。
- 该方法首次为使用端到端算法训练带有ReLU激活的ResNet型网络提供了可证明的线性收敛保证。
- 该方法为无参数方法,除训练轮数外无需学习率或其他超参数。
- 实验结果表明,与标准梯度下降相比,该方法在成功率方面表现更优,尤其在模型复杂度增加时优势更明显。
- 在足够样本下,该算法可在更深的ReLU网络上收敛至零训练损失,但对深度≥2的严格理论保证仍是开放研究方向。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。