Skip to main content
QUICK REVIEW

[论文解读] Maximum sampled conditional likelihood for informative subsampling

HaiYing Wang, Jae Kwang Kim|arXiv (Cornell University)|Nov 11, 2020
Distributed Sensor Networks and Detection Algorithms参考文献 31被引用 10
一句话总结

本文提出了最大采样条件似然估计器(MSCLE),用于大数据中的信息性子采样,利用实际采样概率以提高估计效率。证明了MSCLE在无偏估计器中具有最小的渐近方差,理论与实践中均优于逆概率加权(IPW),尤其在试点模型误设情况下表现更优。

ABSTRACT

Subsampling is a computationally effective approach to extract information from massive data sets when computing resources are limited. After a subsample is taken from the full data, most available methods use an inverse probability weighted (IPW) objective function to estimate the model parameters. The IPW estimator does not fully utilize the information in the selected subsample. In this paper, we propose to use the maximum sampled conditional likelihood estimator (MSCLE) based on the sampled data. We established the asymptotic normality of the MSCLE and prove that its asymptotic variance covariance matrix is the smallest among a class of asymptotically unbiased estimators, including the IPW estimator. We further discuss the asymptotic results with the L-optimal subsampling probabilities and illustrate the estimation procedure with generalized linear models. Numerical experiments are provided to evaluate the practical performance of the proposed method.

研究动机与目标

  • 为解决在选择概率依赖于协变量和响应变量时,逆概率加权(IPW)在信息性子采样中效率低下的问题。
  • 开发一种基于似然的估计器,充分利用所选子样本中的信息,而非依赖加权方法。
  • 建立所提出的最大采样条件似然估计器(MSCLE)的渐近正态性与效率。
  • 证明MSCLE在一类渐近无偏估计器中具有最低的渐近方差,包括IPW。
  • 提供一种使用试点样本估计子采样概率的实用估计程序,即使试点模型存在误设也适用。

提出的方法

  • 基于所选数据的条件对数似然,提出最大采样条件似然估计器(MSCLE)。
  • 在似然函数中使用实际采样概率,而非加权方法,以保留所选样本中的信息。
  • 将采样子似然定义为 $\ell_S(\bm{\theta} \mid \tilde{\bm{\vartheta}}_{\text{plt}}) = \sum_{i=1}^N \delta_i \left[ \log f(y_i \mid \bm{x}_i; \bm{\theta}) - \log \bar{\pi}_N(\bm{x}_i; \bm{\theta} \mid \tilde{\bm{\vartheta}}_{\text{plt}}) \right] + C$,其中 $\bar{\pi}_N$ 为选择概率的条件期望。
  • 在正则性条件下推导MSCLE的渐近分布,包括得分函数与海塞函数的矩界。
  • 证明MSCLE的渐近方差是在所有渐近无偏估计器中最小的,达到Cramér-Rao下界。
  • 使用试点估计器 $\tilde{\bm{\vartheta}}_{\text{plt}}$ 来估计子采样概率,假设其依概率收敛且与完整数据独立。

实验结果

研究问题

  • RQ1基于似然的估计器若利用实际采样概率,是否可在信息性子采样中实现比逆概率加权更高的效率?
  • RQ2最大采样条件似然估计器(MSCLE)是否在所有无偏估计器中实现最小渐近方差?
  • RQ3当试点估计器不一致或有偏时,MSCLE在试点误设下的表现如何?
  • RQ4在一般信息性子采样设计下,当 $n = o(N)$ 时,MSCLE的渐近分布为何?
  • RQ5MSCLE是否可使用试点样本实际实现?即使试点样本不具代表性,其效率是否仍能保持?

主要发现

  • MSCLE在所有渐近无偏估计器中具有最小的渐近方差,证明其统计效率最高,并达到Cramér-Rao下界。
  • MSCLE在试点误设下比IPW估计器更具稳健性,即使试点估计器不一致,仍能保持良好性能。
  • 在正则性条件下(包括得分函数与海塞函数的矩界),已建立MSCLE的渐近正态性。
  • 所提方法允许子样本大小 $n = o(N)$,适用于大规模数据,显著降低计算成本。
  • 数值实验表明,MSCLE在估计效率与收敛速度方面均优于IPW,尤其在不平衡或罕见事件场景中表现更优。
  • 与IPW不同,MSCLE不要求选择概率远离零,因此在高维或稀疏采样场景中更具灵活性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。