Skip to main content
QUICK REVIEW

[论文解读] Nonuniform Negative Sampling and Log Odds Correction with Rare Events Data

HaiYing Wang, Aonan Zhang|arXiv (Cornell University)|Oct 25, 2021
Imbalanced Data Classification Techniques参考文献 36被引用 8
一句话总结

本文提出了一种带有对数似然比校正的非均匀负采样策略,以改进罕见事件数据中的参数估计,其中正样本极为稀少。通过推导最优采样概率并引入一种校正采样偏差的似然估计器,该方法实现了最小的渐近方差,并优于逆概率加权法,在模拟数据和包含0.3万亿条记录的真实世界点击率(CTR)数据集上得到验证。

ABSTRACT

We investigate the issue of parameter estimation with nonuniform negative sampling for imbalanced data. We first prove that, with imbalanced data, the available information about unknown parameters is only tied to the relatively small number of positive instances, which justifies the usage of negative sampling. However, if the negative instances are subsampled to the same level of the positive cases, there is information loss. To maintain more information, we derive the asymptotic distribution of a general inverse probability weighted (IPW) estimator and obtain the optimal sampling probability that minimizes its variance. To further improve the estimation efficiency over the IPW method, we propose a likelihood-based estimator by correcting log odds for the sampled data and prove that the improved estimator has the smallest asymptotic variance among a large class of estimators. It is also more robust to pilot misspecification. We validate our approach on simulated data as well as a real click-through rate dataset with more than 0.3 trillion instances, collected over a period of a month. Both theoretical and empirical results demonstrate the effectiveness of our method.

研究动机与目标

  • 解决正样本相对于负样本极为稀少的罕见事件数据中的参数估计挑战,即存在极端类别不平衡的情况。
  • 通过证明估计精度在渐近意义上仅依赖于正样本数量,为仅保留正样本时负采样作为信息保持方法提供理论依据。
  • 推导出最小化逆概率加权(IPW)估计器无条件渐近方差的最优非均匀负采样概率。
  • 提出一种基于似然的估计器,通过非均匀对数似然比校正实现比IPW更低的渐近方差,并对模型误设更具鲁棒性。
  • 在模拟数据和包含超过0.3万亿条记录的真实世界在线CTR数据集上验证该方法。

提出的方法

  • 作者推导了一般二值响应模型下一般逆概率加权(IPW)估计器的渐近分布,表明估计误差仅取决于正样本数量。
  • 推导出最小化IPW估计器无条件渐近方差的负样本最优采样概率,同时考虑了条件方差之外的数据随机性。
  • 通过在似然函数中校正对数似然比以考虑非均匀采样,提出一种基于似然的估计器,其效率优于IPW。
  • 在对数似然中使用非均匀加权方案以校正采样偏差,确保在子采样下参数估计的一致性。
  • 理论分析证明,所提出的似然估计器在一大类估计器中具有最小的渐近方差。
  • 该方法在包含超过0.3万亿条记录的大规模在线CTR数据集上实现并评估,展示了其可扩展性与鲁棒性。

实验结果

研究问题

  • RQ1在罕见事件数据中,负采样是否可以无信息损失地使用?在何种条件下这一做法是合理的?
  • RQ2什么是最优的非均匀负样本采样概率,可使IPW估计器的渐近方差最小化?
  • RQ3如何提升IPW的估计效率?基于对数似然比校正的似然方法是否能实现更低的方差?
  • RQ4在非均匀采样下,所提出的似然估计器对模型误设的鲁棒性如何?
  • RQ5所提出的方法是否在真实世界、大规模罕见事件数据(如在线点击率预测)中保持优越性能?

主要发现

  • 全样本估计器与真实参数之间的差异以仅由正样本数量决定的速率收敛于正态分布,这为激进的负采样提供了理论支持。
  • 当负样本被子采样至与正样本相同水平时,会发生信息损失,其表现为IPW估计器中的方差膨胀。
  • 所推导的最优非均匀采样概率可最小化IPW估计器的无条件渐近方差,优于均匀采样。
  • 所提出的基于似然的估计器结合非均匀对数似然比校正,在一大类估计器中实现了最小的渐近方差,展现出更优的效率。
  • 在包含超过0.3万亿条记录的真实CTR数据集上的实证结果证实了该方法的有效性与可扩展性,基于似然的估计器始终优于IPW及其他基线方法。
  • 该方法在模型误设下依然保持鲁棒性,尤其当真实数据生成过程偏离线性时,如在使用非线性激活函数的消融研究中所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。