Skip to main content
QUICK REVIEW

[论文解读] Optimal Subsampling for Large Sample Ridge Regression

Yunlu Chen, Nan Zhang|arXiv (Cornell University)|Apr 10, 2022
Machine Learning and Algorithms被引用 4
一句话总结

本文提出了一种针对大规模样本岭回归的最优子采样方法,通过结合岭核迹得分与预测变量的ℓ₂范数,最小化渐近均方误差。该方法采用高效的近似算法以降低计算成本,并在合成数据集和真实世界数据集上展现出优于现有子采样方法的统计精度与效率,尤其在小至中等规模子样本下表现更优。

ABSTRACT

Subsampling is a popular approach to alleviating the computational burden for analyzing massive datasets. Recent efforts have been devoted to various statistical models without explicit regularization. In this paper, we develop an efficient subsampling procedure for the large sample linear ridge regression. In contrast to the ordinary least square estimator, the introduction of the ridge penalty leads to a subtle trade-off between bias and variance. We first investigate the asymptotic properties of the subsampling estimator and then propose to minimize the asymptotic-mean-squared-error criterion for optimality. The resulting subsampling probability involves both ridge leverage score and L2 norm of the predictor. To further reduce the computational cost for calculating the ridge leverage scores, we propose the algorithm with efficient approximation. We show by synthetic and real datasets that the algorithm is both statistically accurate and computationally efficient compared with existing subsampling based methods.

研究动机与目标

  • 通过开发高效的子采样程序,解决大规模数据集上岭回归的计算负担问题。
  • 克服现有子采样方法在岭回归偏差-方差权衡方面缺乏优化的局限性。
  • 在高维、大规模样本设置下,设计一种平衡统计效率与计算可行性的子采样概率。
  • 提出一种高效的近似算法,以降低计算岭核迹得分的成本,同时不牺牲准确性。
  • 在多样化数据场景下,通过均方误差与计算效率两方面,证明所提方法的优越性。

提出的方法

  • 推导岭回归下子采样估计量的渐近分布,以指导最优性准则的制定。
  • 通过最小化渐近均方误差(AMSE)来制定最优子采样概率,该AMSE同时包含岭核迹得分与每个预测变量的ℓ₂范数。
  • 引入岭核迹得分的快速近似方法,以降低计算复杂度,尤其适用于大样本量n的情况。
  • 实施两阶段采样策略:首先计算近似岭核迹得分,然后基于岭核迹得分与ℓ₂范数的组合分配采样概率。
  • 利用所选子样本来计算一个近似全样本估计量的岭回归估计量。
  • 使用合成数据与真实世界数据集验证该方法,与基线方法(如均匀采样、RLEV、OPT与IBOSS)进行性能对比。

实验结果

研究问题

  • RQ1如何在大规模样本设置下,为岭回归设计最优的子采样策略,以平衡偏差与方差?
  • RQ2在岭回归中,最小化渐近均方误差的最优子采样概率是什么?
  • RQ3如何高效地近似岭核迹得分,以降低计算成本,同时保持统计准确性?
  • RQ4与现有子采样方法相比,所提方法在估计精度与计算效率方面表现如何?
  • RQ5当真实模型并不强烈受益于岭正则化时,该方法是否仍保持其优势?

主要发现

  • 在合成实验中,所提出的ROPT方法在所有测试子样本规模下均实现了最低的均方误差(MSE),优于RLEV、RUNIF、OPT与IBOSS。
  • 岭核迹得分的快速近似(ROPT)与精确版本(ROPT-acc)性能几乎完全一致,证实了该近似方法的有效性。
  • 在包含超过39,000个样本的Online News Popularity数据集上,ROPT方法在所有子样本规模下均持续实现最低的测试误差,且在r=100时达到最小的对数测试误差(0.007),优于所有竞争方法。
  • 当子样本规模较小时或中等时,ROPT方法相对于其他方法保持显著优势,且仅在子样本规模增大时性能差距才逐渐缩小。
  • 即使真实模型并未显著受益于岭惩罚,该方法仍保持有效性,表明其对模型误设具有鲁棒性。
  • 在采样概率中同时使用岭核迹得分与ℓ₂范数,相比仅依赖任一成分的方法,能实现更高的统计效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。