[论文解读] To Each Optimizer a Norm, To Each Norm its Generalization
本文提出了一种新框架,用于识别线性模型中优化器找到的任意插值解所对应的隐式正则化范数,从而将传统问题从‘优化器是否最小化已知范数’转变为‘隐式最小化的范数是什么’。通过证明每个插值解都最小化一个唯一的二次范数,作者使基于投影的技术能够改善泛化性能——尤其是偏好数据诱导范数而非标准 ℓ₂ 范数——并通过理论和合成实验在欠参数化和过参数化设置下均展示了改进的测试性能。
We study the implicit regularization of optimization methods for linear models interpolating the training data in the under-parametrized and over-parametrized regimes. Since it is difficult to determine whether an optimizer converges to solutions that minimize a known norm, we flip the problem and investigate what is the corresponding norm minimized by an interpolating solution. Using this reasoning, we prove that for over-parameterized linear regression, projections onto linear spans can be used to move between different interpolating solutions. For under-parameterized linear classification, we prove that for any linear classifier separating the data, there exists a family of quadratic norms ||.||_P such that the classifier's direction is the same as that of the maximum P-margin solution. For linear classification, we argue that analyzing convergence to the standard maximum l2-margin is arbitrary and show that minimizing the norm induced by the data results in better generalization. Furthermore, for over-parameterized linear classification, projections onto the data-span enable us to use techniques from the under-parameterized setting. On the empirical side, we propose techniques to bias optimizers towards better generalizing solutions, improving their test performance. We validate our theoretical results via synthetic experiments, and use the neural tangent kernel to handle non-linear models.
研究动机与目标
- 解决在因过参数化或欠参数化导致无限多解时,确定优化方法在线性模型中隐式最小化哪个范数的挑战。
- 克服先前研究的局限性:即假设优化器收敛到最小 ℓ₂-范数或最大 ℓ₂-间隔解,但未对这些假设提供合理依据。
- 开发一种方法,针对任意插值解,识别其对应的二次范数,从而实现对泛化性能的针对性改进。
- 通过理论和实证方法验证,在线性分类中,数据诱导范数(如数据张成范数)的泛化性能优于标准 ℓ₂ 范数。
- 通过将解投影到数据张成空间,将欠参数化设置中的技术扩展到过参数化设置,从而在高维模型中实现更好的泛化性能。
提出的方法
- 提出一种对偶视角:不再追问优化器最小化的是哪个已知范数,而是确定插值解所最小化的唯一二次范数 ∥⋅∥P。
- 利用投影到线性子空间(尤其是数据张成空间)的方法,转换解并实现不同插值解之间的切换,从而实现对隐式偏差的控制。
- 在欠参数化线性分类中,证明任意线性分类器方向等价于某个正定矩阵 P 的最大 P-间隔解。
- 提出一种数据张成投影技术,使过参数化设置中的优化器能够通过与数据诱导范数对齐,恢复出泛化性能更好的解。
- 使用数据协方差矩阵 Σ⁻¹ 进行预条件处理,以最大化相对间隔,从而提升与贝叶斯最优分类器的对齐程度。
- 利用神经正切核(NTK)将理论发现扩展到非线性模型,从而在更广泛背景下验证结果。
实验结果
研究问题
- RQ1在给定的线性模型中,优化器找到的插值解所对应的隐式正则化范数是什么?
- RQ2通过将优化器迭代过程投影到数据张成空间,能否改善泛化性能?这是否会导致最小化更优范数的解?
- RQ3标准假设——梯度下降收敛到最小 ℓ₂-范数解——是否对泛化最优?还是数据诱导范数能带来更好的性能?
- RQ4使用数据协方差矩阵进行预条件处理,对线性分类中收敛到最大相对间隔解有何影响?
- RQ5能否通过将解投影到数据张成空间,将欠参数化设置中的技术适配到过参数化设置中,从而改善泛化性能?
主要发现
- 在线性回归中,每个插值解都对应一个唯一的二次范数 ∥⋅∥P,使其最小化,从而为系统分析和控制隐式正则化提供了方法。
- 将优化器迭代过程投影到数据张成空间,可恢复最小 ℓ₂-范数解,并在回归和分类任务中显著提升泛化性能。
- 在欠参数化线性分类中,任意完美分类器的方向等价于某个正定矩阵 P 的最大 P-间隔解,表明范数的选择并非任意。
- 通过 Σ⁻¹ 预条件处理最小化数据诱导范数的解,其泛化性能优于 ℓ₂-最大间隔解,这在合成实验中通过与贝叶斯最优分类器的对齐程度得到验证。
- 在过参数化设置中,将 Adagrad 和梯度下降的迭代过程投影到数据张成空间,可降低 ℓ₂ 范数和与最大间隔解的夹角,从而提升测试准确率并增强对异常值的鲁棒性。
- 实证结果表明,使用 Σ⁻¹ 预条件处理的梯度下降方法能获得更高的相对间隔,并在测试性能上表现更优,尤其在标准 ℓ₂-间隔方法误分类的测试点上。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。