Skip to main content
QUICK REVIEW

[论文解读] Bayesian Modeling and MCMC Computation in Linear Logistic Regression for Presence-only Data

Fabio Divino, Natalia Golini|arXiv (Cornell University)|May 6, 2013
Statistical Methods and Bayesian Inference参考文献 25被引用 3
一句话总结

本文提出一种基于数据增强的贝叶斯分层模型,用于对仅有存在数据的线性逻辑回归进行建模,采用两级框架处理右删失和抽样偏差问题。该研究提出一种新颖的MCMC算法,可在无需预先知晓流行率的情况下估计回归系数和总体流行率,其在24,000组模拟数据集中表现出稳健性能,参数恢复一致且流行率估计准确。

ABSTRACT

Presence-only data are referred to situations in which, given a censoring mechanism, a binary response can be observed only with respect to on outcome, usually called extit{presence}. In this work we present a Bayesian approach to the problem of presence-only data based on a two levels scheme. A probability law and a case-control design are combined to handle the double source of uncertainty: one due to the censoring and one due to the sampling. We propose a new formalization for the logistic model with presence-only data that allows further insight into inferential issues related to the model. We concentrate on the case of the linear logistic regression and, in order to make inference on the parameters of interest, we present a Markov Chain Monte Carlo algorithm with data augmentation that does not require the a priori knowledge of the population prevalence. A simulation study concerning 24,000 simulated datasets related to different scenarios is presented comparing our proposal to optimal benchmarks.

研究动机与目标

  • 解决仅有存在数据中的推断挑战,其中仅可观察到存在和协变量,而无缺失数据的直接信息。
  • 开发一种贝叶斯框架,通过两级分层模型同时处理右删失和抽样偏差。
  • 在不假设已知总体流行率的前提下,实现基于MCMC的回归参数和总体流行率的推断。
  • 对仅有存在抽样下的逻辑回归提供严谨的形式化,阐明其基本假设和可识别性问题。
  • 通过大规模模拟研究,比较所提方法与基准模型在多样化情景下的表现。

提出的方法

  • 该方法采用两级模型:潜在二值响应变量Y(存在/不存在)和可观测的病例对照指标C(存在性抽样)
  • 通过给定X的条件下Y与C的条件独立性,对Y和C的联合分布进行建模,从而在仅有存在抽样下推导出似然函数。
  • 采用数据增强方案以填补缺失的不存在数据,从而实现通过MCMC进行完整贝叶斯推断。
  • MCMC算法联合抽样潜在Y、回归系数β和流行率π,使用吉布斯抽样并结合共轭先验。
  • 该模型无需预先知晓总体流行率π,其作为后验推断的一部分被估计。
  • 方法采用逻辑链接函数:logit(Pr(Y=1|x)) = β₀ + β₁x,对β采用分层先验,对π采用β分布先验。

实验结果

研究问题

  • RQ1如何形式化构建一个贝叶斯分层模型,以处理总体流行率未知的仅有存在数据?
  • RQ2抽样偏差和右删失对仅有存在数据中逻辑回归参数的可识别性和估计有何影响?
  • RQ3基于数据增强的MCMC算法是否可在不预先知晓流行率的情况下,同时估计回归系数和总体流行率?
  • RQ4在不同样本大小和流行率水平下,所提方法与最优基准模型在偏差、覆盖概率和精度方面的表现如何比较?
  • RQ5病例对照设计在仅有存在抽样下实现一致估计中起到何种作用?

主要发现

  • 在所有样本大小下,该方法均能准确恢复真实的回归系数β₀和β₁,且随着样本量增加,后验中位数趋近于真实值。
  • 即使在事先未知真实流行率的情况下,总体流行率π的估计也表现出低偏差和窄的可信区间。
  • 当样本量≥500时,β₀和β₁的后验中位数与真实值的偏差在0.05–0.08之间,覆盖概率接近95%。
  • MCMC算法成功在无需将流行率作为已知输入的情况下估计其值,优于假设固定或错误设定流行率的模型。
  • 在两种情景(i)和(ii)下,该方法均表现出稳定的收敛性和低均方误差,且随着样本量增加,参数估计趋近真实值。
  • 对24,000组数据的模拟研究证实,该方法在多样化数据生成机制下均保持良好的频派性质,包括正确的覆盖概率和低偏差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。