Skip to main content
QUICK REVIEW

[论文解读] Implicit Regularization of Random Feature Models

Arthur Paul Jacot, Berfin Şimşek|arXiv (Cornell University)|Feb 19, 2020
Face and Expression Recognition参考文献 35被引用 8
一句话总结

本文证明了具有有限特征的随机特征(RF)模型通过在核岭回归(KRR)中有效增加岭惩罚,实现隐式正则化。利用随机矩阵理论,研究发现RF预测器的期望值与一个有效岭参数 $\tilde{\lambda} > \lambda$ 的KRR预测器极为接近,且随着特征数量 $P$ 增加,$\tilde{\lambda}$ 单调递减至 $\lambda$,揭示了有限样本下的隐式正则化效应。实验和理论结果表明,平均RF预测器的测试误差与 $\tilde{\lambda}$-KRR预测器的测试误差几乎完全一致。

ABSTRACT

Random Feature (RF) models are used as efficient parametric approximations of kernel methods. We investigate, by means of random matrix theory, the connection between Gaussian RF models and Kernel Ridge Regression (KRR). For a Gaussian RF model with $P$ features, $N$ data points, and a ridge $λ$, we show that the average (i.e. expected) RF predictor is close to a KRR predictor with an effective ridge $ ildeλ$. We show that $ ildeλ > λ$ and $ ildeλ \searrow λ$ monotonically as $P$ grows, thus revealing the implicit regularization effect of finite RF sampling. We then compare the risk (i.e. test error) of the $ ildeλ$-KRR predictor with the average risk of the $λ$-RF predictor and obtain a precise and explicit bound on their difference. Finally, we empirically find an extremely good agreement between the test errors of the average $λ$-RF predictor and $ ildeλ$-KRR predictor.

研究动机与目标

  • 理解有限随机特征(RF)模型的泛化行为,这些模型是核方法的近似,但其有限样本行为远不如其渐近版本被充分理解。
  • 研究特征采样中的随机性如何在RF模型中诱导隐式正则化,特别是与岭惩罚调参的关系。
  • 正式建立期望RF预测器与具有有效岭参数 $\tilde{\lambda}$ 的KRR预测器之间的联系,并量化由此产生的泛化误差差异。
  • 提供平均RF预测器与对应 $\tilde{\lambda}$-KRR预测器之间风险差异的理论界,并通过实验加以验证。

提出的方法

  • 使用随机矩阵理论分析具有 $P$ 个独立同分布高斯特征和岭参数 $\lambda$ 的RF预测器 $\hat{f}^{(RF)}_{\lambda}$ 的分布。
  • 推导出期望RF预测器,并证明其与一个具有有效岭参数 $\tilde{\lambda} > \lambda$ 的核岭回归(KRR)预测器极为接近,该参数依赖于 $P$、$\lambda$ 和数据核矩阵。
  • 证明当 $P$ 增加时,$\tilde{\lambda}$ 单调递减至 $\lambda$,揭示了有限采样带来的隐式正则化。
  • 在固定 $\gamma = P/N$ 的条件下,给出 $\lambda$-RF预测器的期望风险与 $\tilde{\lambda}$-KRR预测器风险之间差异的显式界,表明 $\mathbb{E}[L(\hat{f}^{(RF)}_{\lambda})] = L(\hat{f}^{(K)}_{\tilde{\lambda}}) + \mathcal{O}(P^{-1})$。
  • 通过 $\mathrm{Var}(\hat{f}^{(RF)}_{\lambda}(x)) \leq \frac{c_3 K(x,x) \|y\|_{K^{-1}}^2}{P}$ 的界控制RF预测器在其均值附近的方差,表明随着 $P$ 增大,预测器趋于集中。

实验结果

研究问题

  • RQ1有限随机特征采样如何影响RF模型的泛化性能?
  • RQ2期望RF预测器所近似的有效岭参数 $\tilde{\lambda}$ 是什么?它与显式岭参数 $\lambda$ 有何关系?
  • RQ3平均RF预测器的测试误差与对应 $\tilde{\lambda}$-KRR预测器的测试误差有多接近?
  • RQ4能否以 $P$ 和数据相关量的形式显式界定RF预测器的方差?
  • RQ5RF模型中的隐式正则化是否能解释现代学习模型中观察到的双 descent 现象?

主要发现

  • 具有岭参数 $\lambda$ 的期望RF预测器,可被一个具有有效岭参数 $\tilde{\lambda} > \lambda$ 的KRR预测器极为近似,且在有限 $P$ 下 $\tilde{\lambda}$ 严格大于 $\lambda$。
  • $\tilde{\lambda}$ 随着特征数量 $P$ 的增加单调递减至 $\lambda$,表明有限RF采样带来了隐式正则化。
  • 在固定 $\gamma = P/N$ 的条件下,$\lambda$-RF预测器与 $\tilde{\lambda}$-KRR预测器之间期望测试误差的差异被 $\mathcal{O}(P^{-1})$ 所界,且显式常数依赖于 $\lambda$、$\gamma$ 和数据。
  • 实验上,平均 $\lambda$-RF预测器与 $\tilde{\lambda}$-KRR预测器的测试误差极为接近,即使在 $P$ 和 $N$ 较小时也成立。
  • RF预测器的方差被界为 $\frac{c_3 K(x,x) \|y\|_{K^{-1}}^2}{P}$,表明随着 $P$ 增大,预测器在其均值附近趋于集中。
  • 该结果无需假设训练数据为独立同分布,仅依赖于固定训练数据和随机特征采样。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。