Skip to main content
QUICK REVIEW

[论文解读] Bayesian Inference from Non-Ignorable Network Sampling Designs

Simón Lunagómez, Edoardo M. Airoldi|arXiv (Cornell University)|Jan 19, 2014
HIV, Drug Use, Sexual Risk参考文献 17被引用 6
一句话总结

本文通过显式建模网络结构、抽样机制和响应依赖性,为不可忽略的网络抽样设计(如受访者驱动抽样,RDS)提出了一套贝叶斯推断框架。通过将抽样过程和未观测到的网络成分纳入联合似然,该方法在复杂依赖性和不可忽略抽样条件下,相较于标准方法,实现了更优的频率覆盖概率和更短的可信区间。

ABSTRACT

Consider a population of individuals and a network that encodes social connections among them. We are interested in making inference on finite population and super-population estimands that are a function of both individuals' responses and of the network, from a sample. Neither the sampling frame nor the network are available. However, the sampling mechanism implicitly leverages the network to recruit individuals, thus partially revealing social interactions among the individuals in the sample, as well as their responses. This is a common setting that arises, for instance, in epidemiology and healthcare, where samples from hard-to-reach populations are collected using link-tracing mechanisms, including respondent-driven sampling. In this paper, we study statistical properties of popular network sampling mechanisms. We formulate the estimation problem in terms of Rubin's inferential framework to explicitly account for social network structure. We then identify key modeling elements that lead to inferences with good frequentist properties when dealing with data collected through non-ignorable network sampling mechanisms. We demonstrate these methods on a study of the incidence of HIV in Brazil

研究动机与目标

  • 解决使用基于网络的机制(如受访者驱动抽样,RDS)对难以接触人群进行抽样时,有效统计推断的挑战。
  • 克服在贝叶斯和似然推断中忽略抽样机制的局限性,尤其是在由于网络依赖性导致机制不可忽略的情况下。
  • 构建一个联合建模框架,以考虑未观测网络的不确定性、抽样过程的不确定性以及响应依赖性,从而提高推断准确性。
  • 在RDS应用中,通过实证比较展示该方法在频率性质上的改进,具体表现为更高的覆盖概率和更短的区间长度。
  • 通过显式建模数据生成过程,为设计更优的网络抽样机制提供基础。

提出的方法

  • 将鲁宾的推断框架扩展,显式地将社会网络结构和抽样机制纳入似然函数中。
  • 使用联合分布 $p(Y, \mathcal{G}, I \mid \alpha, \gamma)$ 建模网络 $\mathcal{G}$、响应 $Y$ 和抽样机制 $I$,其中 $\alpha$ 和 $\gamma$ 为模型参数。
  • 采用分层先验结构:$p(\mathcal{G} \mid \alpha)$ 用于网络,$p(Y \mid \mathcal{G}, \gamma)$ 用于响应,$p(I \mid \mathcal{G})$ 用于抽样机制。
  • 通过数据增广法实现后验推断,引入未观测到的节点和边,将 $N$ 视为调优参数并进行敏感性分析。
  • 允许对抽样机制进行灵活建模,无需假设有放回抽样或均匀种子选择。
  • 通过扩展随机图和推荐机制,将协变量和度数信息纳入模型,尽管本研究未完全探索这些扩展。

实验结果

研究问题

  • RQ1当抽样机制由于依赖于未观测到的社会网络而不可忽略时,如何实现有效的贝叶斯推断?
  • RQ2在网络抽样设计中,哪些建模组件对于实现良好的频率性质(如覆盖概率和区间长度)至关重要?
  • RQ3与忽略这些因素相比,联合建模网络结构和抽样机制在多大程度上能改善不确定性量化?
  • RQ4所提出的框架能否在不施加强参数假设的前提下,处理RDS的实际特征(如活动差异和响应依赖性)?
  • RQ5与标准RDS估计器相比,该方法在频率覆盖概率和精度方面的表现如何?

主要发现

  • 所提出的方法相较于标准RDS估计器,实现了更高的频率覆盖概率和更短的可信区间,表明推断准确性得到提升。
  • 显式建模抽样机制和未观测网络结构,即使在网络部分观测的情况下,也能提供更可靠的不确定性估计。
  • 该框架在弱假设下依然有效:不要求网络连通或抽样为有放回抽样。
  • 针对最大节点数 $N$ 的敏感性分析显示方法具有鲁棒性,支持其在实际中的应用。
  • 该方法通过纳入常被忽略但包含关键人口信息的抽样过程,优于传统方法。
  • 对巴西HIV发病率的分析展示了该方法的实际应用价值,并表明即使点估计良好,RDS在推断中仍可能因高不确定性而并非最优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。