[论文解读] The Implicit Regularization of Ordinary Least Squares Ensembles
该论文表明,在高斯假设下,通过在特征和样本上随机子采样训练的普通最小二乘法(OLS)预测器的集成模型,其隐式正则化效果与岭回归相似。当特征子采样经过最优调优时,该集成模型的渐近风险与最优岭回归风险一致,揭示了子采样所导致的隐藏正则化效应,其机制与深度学习中的Dropout相似。
Ensemble methods that average over a collection of independent predictors that are each limited to a subsampling of both the examples and features of the training data command a significant presence in machine learning, such as the ever-popular random forest, yet the nature of the subsampling effect, particularly of the features, is not well understood. We study the case of an ensemble of linear predictors, where each individual predictor is fit using ordinary least squares on a random submatrix of the data matrix. We show that, under standard Gaussianity assumptions, when the number of features selected for each predictor is optimally tuned, the asymptotic risk of a large ensemble is equal to the asymptotic ridge regression risk, which is known to be optimal among linear predictors in this setting. In addition to eliciting this implicit regularization that results from subsampling, we also connect this ensemble to the dropout technique used in training deep (neural) networks, another strategy that has been shown to have a ridge-like regularizing effect.
研究动机与目标
- 理解基于 OLS 的集成方法中特征和样本子采样所产生的隐式正则化效应。
- 确定此类集成模型是否能实现与已知为线性预测器中最佳的岭回归相当的性能。
- 在理论层面建立 OLS 集成模型与深度学习中 Dropout 之间的联系,二者均表现出类似岭回归的正则化特性。
- 在高维渐近框架下,刻画集成模型的渐近风险作为子采样参数的函数。
提出的方法
- 作者研究了 k 个独立的 OLS 预测器组成的集成模型,每个预测器均基于从完整数据矩阵 X ∈ ℝⁿˣᵖ 和目标向量 y ∈ ℝⁿ 中随机选取的特征子集与样本子集进行训练。
- 每个预测器在通过随机选择行(样本)和列(特征)形成的子矩阵上使用普通最小二乘法,最终预测结果为所有 k 个预测器的平均值。
- 在特征和模型权重服从独立同分布高斯分布的假设下,推导了当 n, p → ∞ 时集成模型的渐近风险。
- 分析利用随机矩阵理论及伪逆的性质,计算了期望风险并证明其收敛于岭回归风险。
- 通过随机梯度下降,建立了与 Dropout 的联系,表明该集成模型的行为等价于使用 Dropout 正则化进行训练。
- 关键数学工具包括对零空间上的投影算子的使用以及对随机采样矩阵的期望运算。
实验结果
研究问题
- RQ1OLS 集成模型中的特征子采样是否会产生与岭回归性能相当的隐式正则化?
- RQ2OLS 集成模型的渐近风险如何依赖于每个预测器所选择的特征数量与样本数量?
- RQ3该集成模型的行为能否与深度神经网络中的 Dropout 正则化建立正式联系?
- RQ4在相同数据假设下,OLS 集成模型的最优风险是否等于最优岭回归风险?
主要发现
- 当每个预测器所选特征数量经过最优调优时,OLS 集成模型的渐近风险等于最优渐近岭回归风险。
- 只要每个 OLS 问题为欠定状态,渐近风险仅依赖于特征子采样的程度,而不依赖于样本子采样的程度。
- 即使单个 OLS 预测器未进行正则化,该集成模型仍会隐式地表现出类似岭回归的正则化效果。
- 在 i.i.d. 高斯假设下,当 n, p → ∞ 时,该集成模型的理论风险与岭回归一致。
- 正式建立了 OLS 集成模型与 Dropout 之间的联系,二者均通过随机子采样诱导出类似岭回归的正则化效果。
- 在指定的渐近框架下,随着预测器数量 k 增加,该集成模型的风险收敛至最优风险。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。