Skip to main content
QUICK REVIEW

[论文解读] Loss-Proportional Subsampling for Subsequent ERM

Paul Mineiro, Nikos Karampatziakis|arXiv (Cornell University)|Jun 7, 2013
Machine Learning and Algorithms参考文献 6被引用 5
一句话总结

本文提出损失比例子采样(loss-proportional subsampling),一种基于初始线性模型预测误差选择训练样本的方法,以在经验风险最小化(ERM)前减少数据规模。通过将样本权重设置为其损失的倒数,该方法保持了统计效率,在显著减少数据量的情况下,仍能实现与全量数据ERM相当的过失风险,如经验 Bernstein 不等式所示,并在大规模提升树模型上得到验证。

ABSTRACT

We propose a sampling scheme suitable for reducing a data set prior to selecting a hypothesis with minimum empirical risk. The sampling only considers a subset of the ultimate (unknown) hypothesis set, but can nonetheless guarantee that the final excess risk will compare favorably with utilizing the entire original data set. We demonstrate the practical benefits of our approach on a large dataset which we subsample and subsequently fit with boosted trees.

研究动机与目标

  • 开发一种统计高效的子采样策略,在经验风险最小化(ERM)前减少数据规模,且无需对最终假设集的先验知识。
  • 解决大规模学习工作流中因全量数据无法在单台机器上处理而面临的减量挑战。
  • 确保子采样后的过失风险与全量数据 ERM 的结果相当,即使最终假设空间未知且可能复杂。
  • 利用经验 Bernstein 不等式建立泛化性能的理论保证,将子采样质量与初始模型的准确性关联起来。

提出的方法

  • 该方法使用预训练线性模型在全量数据集上计算预测误差(损失)。
  • 随后根据损失值按比例对样本进行子采样,优先选择高损失样本。
  • 强制执行最小采样概率 $P_{\text{min}}$,以确保稳定性和理论保证。
  • 在子样本上进行 ERM 时应用重要性加权,以校正采样偏差。
  • 理论分析使用经验 Bernstein 不等式,对最终 ERM 模型的过失风险进行上界估计。
  • 该方法设计为仅在 ERM 前应用一次,递归应用虽可能但对实际性能提升影响较小。

实验结果

研究问题

  • RQ1我们能否以一种方式对大规模数据集进行子采样,使得其在全量数据上 ERM 的泛化性能得以保留,即使最终假设空间未知?
  • RQ2如何设计一种子采样策略,利用简单的初始模型指导样本选择,而无需对最终模型类别有先验知识?
  • RQ3在损失比例子采样后,能否为最终 ERM 模型的过失风险建立理论边界?
  • RQ4初始模型的质量(如线性预测器)如何影响可实现的数据缩减程度和最终性能?
  • RQ5该方法能否在减少训练数据规模的同时,相比均匀子采样展现出更高的统计效率?

主要发现

  • 即使最终假设空间未知且复杂,该方法在子采样后仍能达到 $O(1/\sqrt{n})$ 的过失风险边界,与全量数据 ERM 的速率一致。
  • 理论分析表明,过失风险取决于初始模型的经验风险 $R_{\mathbf{X}}(\tilde{h})$ 和最小采样概率 $P_{\text{min}}$,当初始模型准确时边界更紧。
  • 只要初始模型足够好,该方法可保证子样本上最终 ERM 的过失风险与全量数据 ERM 的结果相当。
  • 大规模数据集上的实证结果表明,损失比例子采样结合提升树模型在泛化性能上优于均匀子采样。
  • 该方法可实现显著的数据缩减——尤其当初始模型能识别出信息量高、损失大的样本时——且不牺牲统计效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。