[论文解读] Generalized Leverage Score Sampling for Neural Networks
该论文将核近似中的杠杆度采样方法推广至更广泛的核函数,并应用于深度学习,表明通过杠杆度采样初始化训练的正则化ReLU神经网络等价于神经正切核岭回归。该方法通过优化初始化方差,降低了实现近似精度所需的网络宽度,同时保持收敛性保证。
Leverage score sampling is a powerful technique that originates from theoretical computer science, which can be used to speed up a large number of fundamental questions, e.g. linear regression, linear programming, semi-definite programming, cutting plane method, graph sparsification, maximum matching and max-flow. Recently, it has been shown that leverage score sampling helps to accelerate kernel methods [Avron, Kapralov, Musco, Musco, Velingker and Zandieh 17]. In this work, we generalize the results in [Avron, Kapralov, Musco, Musco, Velingker and Zandieh 17] to a broader class of kernels. We further bring the leverage score sampling into the field of deep learning theory. $\bullet$ We show the connection between the initialization for neural network training and approximating the neural tangent kernel with random features. $\bullet$ We prove the equivalence between regularized neural network and neural tangent kernel ridge regression under the initialization of both classical random Gaussian and leverage score sampling.
研究动机与目标
- 将杠杆度采样从平移不变核推广至通过随机特征定义的更广泛核类。
- 在高斯分布和杠杆度采样初始化下,建立正则化深度神经网络训练与神经正切核岭回归之间的理论等价性。
- 通过优化基于杠杆度采样的初始化,降低实现近似精度所需的网络宽度。
- 为在过参数化深度学习中使用结构化初始化提供理论基础,尤其结合正则化方法。
- 将等价性扩展至多层ReLU网络,并讨论其向CNN和SGD训练的潜在扩展。
提出的方法
- 将杠杆度采样推广至形如 $\mathsf{K}(x,z) = \mathbb{E}_{w \sim p}[\phi(x,w)^\top \phi(z,w)]$ 的核函数,其中 $\phi$ 为有限维特征映射。
- 利用杠杆度采样构建核矩阵的低秩近似,从而减少实现准确近似所需的随机特征维度。
- 证明在高斯分布和杠杆度采样初始化下,正则化神经网络的梯度流动态与核岭回归完全等价。
- 通过杠杆度采样控制神经正切核与初始化的扰动,确保收敛至核解。
- 利用ReLU网络的分段线性特性,推导梯度流中的正则化项,从而实现与核岭回归的等价性。
- 通过按层数缩放网络宽度,将分析扩展至多层ReLU网络,确保在适当初始化下保持等价性。
实验结果
研究问题
- RQ1杠杆度采样能否推广至超越平移不变核的更广泛核类?
- RQ2杠杆度采样是否能改善深度学习中近似神经正切核所需的样本复杂度或网络宽度?
- RQ3在使用杠杆度采样初始化时,正则化神经网络训练与核岭回归之间是否存在等价性?
- RQ4与标准高斯初始化相比,杠杆度采样在实现收敛所需的网络宽度方面表现如何?
- RQ5该等价性能否扩展至全参数训练的更深神经网络架构?
主要发现
- 本文在高斯分布和杠杆度采样初始化下,建立了正则化ReLU神经网络训练与神经正切核岭回归之间的理论等价性。
- 杠杆度采样可降低对初始化扰动控制所需的网络宽度,可能改善初始化阶段的样本复杂度。
- 收敛所需的宽度在渐近意义上与高斯初始化相同,但杠杆度采样优化了初始化误差的上界。
- 当网络宽度按层数进行缩放时,该等价性在多层ReLU网络中依然成立,且梯度流动态保持一致。
- 通过在杠杆度采样中引入正则化,该方法为核近似所需随机特征维度提供了更紧的上界。
- 结果表明,若未来分析能进一步改进训练阶段的宽度上界,使其成为主导因素,则杠杆度采样在实践中可能更具优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。