[论文解读] Quantifying the Benefit of Using Differentiable Learning over Tangent Kernels
本文表明,对于神经网络等可微模型,梯度下降即使在对应的神经正切核(NTK)相较于随机猜测无显著优势时,仍可实现低测试误差——这与以往假设相悖。关键洞见在于:通过偏差初始化,梯度下降可在核方法失效时仍取得成功,凸显了非凸优化与基于核方法在学习能力上的根本性差异。
We study the relative power of learning with gradient descent on differentiable models, such as neural networks, versus using the corresponding tangent kernels. We show that under certain conditions, gradient descent achieves small error only if a related tangent kernel method achieves a non-trivial advantage over random guessing (a.k.a. weak learning), though this advantage might be very small even when gradient descent can achieve arbitrarily high accuracy. Complementing this, we show that without these conditions, gradient descent can in fact learn with small error even when no kernel method, in particular using the tangent kernel, can achieve a non-trivial advantage over random guessing.
研究动机与目标
- 研究可微模型上的梯度下降是否能在对应神经正切核(NTK)无法实现弱学习(即显著优于随机猜测)时仍能成功。
- 确定梯度下降的成功是否依赖于NTK具备非平凡优势,尤其是在不同初始化方案下。
- 考察输入分布知识在使梯度下降成功超越核方法中的作用。
- 阐明可微学习超越基于核学习的条件,特别是在分布无关学习设置中。
- 证明偏差初始化可使梯度下降学习复杂函数,即使所有核方法(包括NTK)均无法实现非平凡优势。
提出的方法
- 构建一个合成学习问题,其中在神经网络上使用梯度下降可实现任意低误差,而初始化时的NTK边缘接近零。
- 在定理1中证明:在无偏初始化(即初始化时输出为零)下,梯度下降仅当NTK相对于随机猜测具有多项式有界边缘时才能成功。
- 提出一种依赖于输入分布的随机初始化方案,表明在期望下,该随机初始化点的NTK可实现非平凡边缘,当梯度下降成功时。
- 利用定理2表明:对于平方损失,若梯度下降从任意初始化均能成功,则存在一种依赖于分布的随机初始化,使得该点的NTK具有非平凡边缘。
- 通过构造反例分析初始化偏差的作用,证明在偏差初始化下梯度下降可成功,但任何核方法(包括NTK)均无法实现非平凡边缘。
- 通过在奇偶性类似函数上的两层ReLU网络进行实验验证,表明梯度下降在核方法失败时仍能成功。
实验结果
研究问题
- RQ1当对应神经正切核(NTK)相较于随机猜测无非平凡优势时,可微模型上的梯度下降是否仍能学习某一函数?
- RQ2梯度下降的成功是否依赖于NTK实现非平凡优势,特别是在无偏初始化下?
- RQ3在分布无关学习设置中,梯度下降是否可在无任何核方法实现非平凡优势时仍能成功?
- RQ4输入分布知识在使梯度下降超越基于核的方法中起到什么作用?
- RQ5初始化偏差如何影响梯度下降与核方法之间学习能力的关系?
主要发现
- 即使NTK边缘接近零,梯度下降仍可实现任意低误差,证明了可微学习与基于核学习之间存在严格分离。
- 在无偏初始化(即初始化时输出为零)下,梯度下降仅当NTK相对于随机猜测具有多项式有界边缘时才能成功,如定理1所形式化。
- 通过偏差初始化,梯度下降可成功,即使任何核方法(包括NTK)均无法实现非平凡边缘,如第5节所示。
- 对于平方损失,若梯度下降从任意初始化均能成功,则存在一种依赖于分布的随机初始化,使得该点的NTK具有非平凡边缘,如定理2所证明。
- NTK在随机初始化下成功依赖于分布相关初始化,凸显了核方法与梯度下降在利用输入分布结构方面的根本差异。
- 两层ReLU网络的实验结果确认,当核方法失败时,梯度下降仍可学习复杂函数(如奇偶性函数),尤其在可通过相关性识别关键特征时。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。