[论文解读] Implicit Regularization via Neural Feature Alignment
本文提出,深度学习中的隐式正则化源于训练过程中神经正切特征沿任务相关方向的动力学对齐,其作用如同特征选择与压缩机制的结合。通过分析正切核谱及其与类别标签的对齐关系,作者提出了一种启发式复杂度度量,其与泛化性能的相关性强于以往方法。
We approach the problem of implicit regularization in deep learning from a geometrical viewpoint. We highlight a regularization effect induced by a dynamical alignment of the neural tangent features introduced by Jacot et al, along a small number of task-relevant directions. This can be interpreted as a combined mechanism of feature selection and compression. By extrapolating a new analysis of Rademacher complexity bounds for linear models, we motivate and study a heuristic complexity measure that captures this phenomenon, in terms of sequences of tangent kernel classes along optimization paths.
研究动机与目标
- 理解过参数化深度神经网络中隐式正则化机制如何在无显式正则化的情况下实现泛化。
- 研究神经正切特征的几何结构在训练过程中的演化方式及其对模型容量的影响。
- 基于正切核对齐提出一种新的启发式复杂度度量,以更准确地预测泛化性能。
提出的方法
- 将神经正切特征的非中心化协方差作为函数类上的度量张量,类似于费雪信息度量。
- 利用正切核的谱分解,追踪主成分在优化过程中与任务相关方向的对齐变化。
- 基于正切核谱的各向异性和其与标签核通过中心化核对齐(CKA)的对齐关系,提出一种启发式复杂度度量。
- 通过正切核动力学,将Rademacher复杂度分析从线性模型推广至非线性设置。
- 通过保留的测试集,对MLP、VGG19、ResNet18等架构以及MNIST、CIFAR10等数据集上的对齐动态进行实证评估。
- 通过消融实验分析深度、学习率和标签噪声的影响,以验证对齐效应的鲁棒性与普适性。
实验结果
研究问题
- RQ1在谱各向异性和与类别标签对齐方面,神经正切特征在训练过程中如何演化?
- RQ2正切特征的动力学对齐在多大程度上可视为一种隐式正则化形式?
- RQ3基于正切核对齐的新型启发式复杂度度量是否能比现有度量更准确地预测泛化性能?
- RQ4该对齐现象是否在不同架构、数据集和训练超参数下均持续存在?
- RQ5深度如何影响训练过程中特征对齐的启动时机与强度?
主要发现
- 在2D Disk数据集上,正切核的谱在训练过程中变得越来越各向异性,第20个特征值与第一个特征值的比值从初始化时的1.5%下降至2000次迭代后的0.2%。
- 正切核的前导特征函数演化以捕捉数据中的结构模式,例如在Disk数据集中的类别边界(如圆形边界),表明其与任务相关特征对齐。
- 在所有架构和数据集上,正切核与标签核之间的中心化核对齐(CKA)在训练过程中显著增加,表明与目标函数的对齐程度不断提高。
- 所提出的启发式复杂度度量与泛化性能的相关性强于现有度量,如谱范数、Frobenius范数和参数范数。
- 更深的网络表现出更延迟但更显著的对齐增长,其易例与难例之间的对齐比值更高,表明深度增强了隐式正则化效应。
- 即使在未中心化的核上,对齐效应依然存在,证实其并非中心化带来的伪影,而是正切特征动力学的稳健属性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。