Skip to main content
QUICK REVIEW

[论文解读] Central limit theorems for network driven sampling

Li Xiao, Karl Rohe|arXiv (Cornell University)|Sep 15, 2015
HIV, Drug Use, Sexual Risk参考文献 20被引用 3
一句话总结

本文建立了网络驱动抽样中的中心极限定理,将受访者驱动抽样(RDS)建模为树索引的马尔可夫过程。证明了在临界阈值以下时,Volz-Heckathorn估计量渐近正态,并表明在某些情况下,当结果与抽样权重不相关时,样本均值的均方误差低于逆概率加权法(IPW),这是由于方差降低所致。

ABSTRACT

Respondent-Driven Sampling is a popular technique for sampling hidden populations. This paper models Respondent-Driven Sampling as a Markov process indexed by a tree. Our main results show that the Volz-Heckathorn estimator is asymptotically normal below a critical threshold. The key technical difficulties stem from (i) the dependence between samples and (ii) the tree structure which characterizes the dependence. The theorems allow the growth rate of the tree to exceed one and suggest that this growth rate should not be too large. To illustrate the usefulness of these results beyond their obvious use, an example shows that in certain cases the sample average is preferable to inverse probability weighting. We provide a test statistic to distinguish between these two cases.

研究动机与目标

  • 在树索引马尔可夫过程模型下,建立受访者驱动抽样(RDS)中估计量的渐近正态性。
  • 解决RDS中依赖样本和复杂树状结构的转介网络带来的挑战。
  • 确定在何种情况下样本均值的均方误差低于逆概率加权(IPW)估计量。
  • 提供一个检验统计量,用于基于偏差与方差权衡选择样本均值与IPW估计量。

提出的方法

  • 在有限无向图上将RDS建模为树索引的马尔可夫过程,其中转介形成根树结构。
  • 使用Volz-Heckathorn估计量作为逆概率加权(IPW)估计量的代理,以实现渐近分析。
  • 在一般树生长速率下,对样本均值和Volz-Heckathorn估计量应用中心极限定理。
  • 利用图论量(包括转移概率和平稳测度)推导两种估计量的方差表达式。
  • 提出一个检验统计量,用于检验样本均值偏差是否为零,从而实现估计量之间的数据驱动选择。
  • 采用谱图论和转移矩阵的特征值分解,分析依赖结构与方差分量。

实验结果

研究问题

  • RQ1在何种条件下,Volz-Heckathorn估计量在网络驱动抽样中渐近正态?
  • RQ2在RDS中,样本均值何时的均方误差低于逆概率加权估计量?
  • RQ3转介树的增长速率如何影响RDS中估计量的渐近方差?
  • RQ4结果与抽样权重之间的相关性在决定估计量效率方面起什么作用?
  • RQ5能否构建一个检验统计量,以区分样本均值优于IPW的情况?

主要发现

  • 当树生长速率低于临界阈值时,Volz-Heckathorn估计量渐近正态。
  • 当结果与抽样权重不相关时,样本均值的均方误差可能低于IPW估计量。
  • IPW估计量的方差至少超出样本均值的方差一个与 $ \frac{C_2}{N C_1^2} $ 成比例的项,表明IPW可能存在效率低下。
  • 推导出一个检验统计量,用于检验样本均值偏差为零的原假设,从而实现估计量的选取。
  • 模拟结果表明,$ \mathbb{G} $(控制方差的函数)通常为凸函数,但并非总是如此,即使在后代分布规则的情况下也是如此。
  • 理论框架即使在i.i.d.假设被违反时,对现实世界RDS仍具有良好的近似效果,模拟验证了这一点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。