Skip to main content
QUICK REVIEW

[论文解读] Local Uncertainty Sampling for Large-Scale Multi-Class Logistic Regression

Lei Han, Kean Ming Tan|arXiv (Cornell University)|Apr 27, 2016
Advanced Statistical Methods and Models参考文献 13被引用 5
一句话总结

本文提出局部不确定性采样(LUS),一种用于大规模多分类逻辑回归的子采样方法,通过基于预测不确定性的数据点选择来最小化估计量方差。LUS在样本数更少的情况下,相较于均匀采样和病例对照采样,能实现更低的方差,尤其在条件类不平衡情况下表现更优,且在理论上具有保障,即使初始估计量为随机时也能保持一致性能。

ABSTRACT

A major challenge for building statistical models in the big data era is that the available data volume far exceeds the computational capability. A common approach for solving this problem is to employ a subsampled dataset that can be handled by available computational resources. In this paper, we propose a general subsampling scheme for large-scale multi-class logistic regression and examine the variance of the resulting estimator. We show that asymptotically, the proposed method always achieves a smaller variance than that of the uniform random sampling. Moreover, when the classes are conditionally imbalanced, significant improvement over uniform sampling can be achieved. Empirical performance of the proposed method is compared to other methods on both simulated and real-world datasets, and these results match and confirm our theoretical analysis.

研究动机与目标

  • 为解决大规模多分类逻辑回归在海量数据集下计算成本过高的挑战。
  • 在保持计算可行性的同时,降低子采样估计量的统计方差。
  • 开发一种能适应数据不确定性与类别不平衡(尤其是条件不平衡)的采样策略。
  • 将现有局部病例对照方法推广至多分类设置,并提供理论保障。
  • 通过实证验证,LUS在统计效率上优于均匀采样和病例对照采样。

提出的方法

  • 提出局部不确定性采样(LUS),根据初始估计量对预测不确定性的高低,为数据点分配更高的接受概率。
  • 使用一致的初始估计量(例如来自小规模均匀样本)来估计条件概率,并识别出不确定性较高的样本。
  • 将接受概率设置为与每个类别的预测概率质量的倒数成正比,从而偏向于不确定性较高的预测。
  • 对最终估计量应用校正方法,以确保一致性并减少偏差,尤其在模型误设情况下。
  • 推导出LUS估计量的渐近方差,并证明其始终小于均匀采样的方差。
  • 将方法扩展至处理边际不平衡与条件不平衡的数据,针对K > 2类提供理论分析。

实验结果

研究问题

  • RQ1能否设计一种子采样方法,在不依赖均匀采样的前提下,降低大规模多分类逻辑回归中估计量的方差?
  • RQ2在条件不平衡条件下,局部不确定性采样与均匀采样和病例对照采样相比,其渐近方差表现如何?
  • RQ3LUS的性能是否依赖于初始估计量的质量?当初始估计量为随机时,其性能是否仍能保持一致?
  • RQ4模型误设对LUS估计量有何影响,特别是在K > 2类的情况下?
  • RQ5LUS能否推广至高维设置并结合正则化方法(如Lasso或Group Lasso)?

主要发现

  • 对于任意给定的期望样本量,LUS始终实现比均匀采样更低的渐近方差,且在强条件不平衡下改善最为显著。
  • 当LUS与LCC达到相同的渐近方差(例如γ = 1.5)时,LUS所需的子样本点数(nSub/n)少于LCC。
  • 实证结果表明,LUS在所有测试的子样本比例(nSub/n = 0.15至0.3)下均表现出比LCC更低的方差,当nSub/n = 0.3时,平均方差分别为1.62与1.73。
  • 只要初始估计量一致,LUS估计量的方差就保持恒定,且不依赖于初始估计量的随机性。
  • 对于K=2,若初始估计量一致,则即使存在模型误设,LUS仍能产生一致估计量;对于K>2,估计量存在偏差,但该偏差可量化。
  • 在Web Spam数据集中,LUS仅使用15–30%的数据即可达到全数据MLE的性能,且在方差和样本效率方面优于LCC与均匀采样。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。