Skip to main content
QUICK REVIEW

[论文解读] More Efficient Estimation for Logistic Regression with Optimal Subsample

HaiYing Wang|arXiv (Cornell University)|Feb 8, 2018
Statistical Methods and Inference参考文献 43被引用 6
一句话总结

本文提出了一种基于Wang等(2018)推导的最优子样本概率的更高效逻辑回归估计方法,引入了一种新颖的加权方案和泊松子样本抽样,以提升估计效率和计算可扩展性。主要贡献在于提出了一种渐近方差小于逆概率加权估计器的新估计量,在子样本大小与完整数据大小成比例时尤其表现出更高的效率。

ABSTRACT

In this paper, we propose improved estimation method for logistic regression based on subsamples taken according the optimal subsampling probabilities developed in Wang et al. 2018 Both asymptotic results and numerical results show that the new estimator has a higher estimation efficiency. We also develop a new algorithm based on Poisson subsampling, which does not require to approximate the optimal subsampling probabilities all at once. This is computationally advantageous when available random-access memory is not enough to hold the full data. Interestingly, asymptotic distributions also show that Poisson subsampling produces a more efficient estimator if the sampling rate, the ratio of the subsample size to the full data sample size, does not converge to zero. We also obtain the unconditional asymptotic distribution for the estimator based on Poisson subsampling. The proposed approach requires to use a pilot estimator to correct biases of un-weighted estimators. We further show that even if the pilot estimator is inconsistent, the resulting estimators are still consistent and asymptotically normal if the model is correctly specified.

研究动机与目标

  • 通过优化最优子样本的加权方案,改进大规模数据集下逻辑回归的估计效率。
  • 通过引入避免存储所有子样本概率的泊松子样本抽样,解决全数据无法装入内存时的计算限制。
  • 在泊松子样本抽样下建立新估计量的渐近分布,证明当子样本比例不趋于零时效率得到提升。
  • 证明即使在初始估计量不一致的情况下,所提方法仍能产生一致且渐近正态的估计量。

提出的方法

  • 提出一种新估计量,使用Wang等(2018)的最优子样本概率,但采用优化的加权方案以降低渐近方差。
  • 引入泊松子样本抽样作为伯努利抽样或无放回抽样的计算高效替代方案,避免同时计算和存储所有子样本概率。
  • 推导基于泊松子样本抽样的估计量的无条件渐近分布,证明当子样本大小与全数据大小成比例时,其效率高于逆概率加权估计器。
  • 采用两阶段方法:第一阶段使用初始估计量计算子样本概率;第二阶段使用校正加权方案计算最终估计量。
  • 应用Hjort和Pollard(2011)的基本推论,推导在条件数学期望下估计量的渐近正态性。
  • 采用渐近分析和鞅中心极限定理技术,推导估计量的极限分布及其方差-协方差结构。

实验结果

研究问题

  • RQ1在逻辑回归的最优子样本抽样中,是否可以通过更优的加权方案使估计效率超越逆概率加权估计器?
  • RQ2当子样本大小与全数据大小成比例时,泊松子样本抽样是否能产生比其他抽样方案更高效的估计量?
  • RQ3当初始估计量不一致时,所提方法是否仍能保持一致性和渐近正态性?
  • RQ4基于泊松子样本抽样的估计量的无条件渐近分布是什么?其与条件分布相比如何?
  • RQ5新估计量的渐近方差与逆概率加权估计量相比,在Loewner序下有何差异?

主要发现

  • 所提估计量的渐近方差-协方差矩阵小于Wang等(2018)中的逆概率加权估计量,经Loewner序验证。
  • 当子样本大小与全数据大小成比例时(即 n/N → ρ > 0),泊松子样本抽样产生的估计量比逆概率加权估计量更高效。
  • 推导出基于泊松子样本抽样的估计量的无条件渐近分布,并证明其渐近正态,且方差-协方差矩阵小于加权估计量。
  • 即使初始估计量不一致,最终估计量仍保持一致且渐近正态,表明对初始估计误差具有鲁棒性。
  • 该方法在计算上具有优势,因为泊松子样本抽样无需同时存储所有子样本概率,适用于内存受限环境。
  • 数值结果证实,新估计量在估计效率上优于现有方法,尤其在大规模逻辑回归场景中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。