Skip to main content
QUICK REVIEW

[论文解读] Application of Bootstrap Re-sampling Method to a Categorical Data of HIV/AIDS Spread across different Social-Economic Classes

Adeshina Oyedele Bello, Festus Abiodun Oguntolu|arXiv (Cornell University)|Sep 25, 2016
Data-Driven Disease Surveillance被引用 6
一句话总结

本研究在尼日利亚奥约州的社会经济阶层中,对分类的HIV/AIDS数据集应用自助重抽样法,使用逻辑回归建模传播风险。结果表明,年龄、就业状况和性别显著影响HIV患病率,其中失业男性表现出最高的预测感染概率,并通过10,000次自助重抽样和BCa置信区间验证了模型的稳定性。

ABSTRACT

This research reports on the relationship and significance of social-economic factors (age, sex, employment status) and modes of HIV/AIDS transmission to the HIV/AIDS spread. Logistic regression model, a form of probabilistic function for binary response was used to relate social-economic factors (age, sex, employment status) to HIV/AIDS spread. The statistical predictive model was used to project the likelihood response of HIV/AIDS spread with a larger population using 10,000 Bootstrap re-sampling observations.

研究动机与目标

  • 建立奥约州社会经济因素(年龄、性别、就业状况)与HIV/AIDS传播之间关系的模型。
  • 利用逻辑回归评估这些因素在预测HIV感染中的显著性。
  • 通过10,000次自助重抽样迭代增强模型的可靠性,以实现大样本推断。
  • 利用基于重抽样的置信区间,对更大人群的感染可能性进行预测。
  • 通过识别高风险群体,为公共卫生规划提供支持,以实施针对性干预措施。

提出的方法

  • 将逻辑回归应用于二元HIV状态(感染/未感染),以年龄、性别和就业状况作为预测变量。
  • 使用10,000次自助重抽样估计标准误,并构建偏差校正加速(BCa)置信区间,用于回归系数。
  • 采用残差分析和概率图评估模型拟合度,并识别影响较大的观测值。
  • 生成按性别和就业状况分层的各年龄组HIV感染的预测概率。
  • 通过拟合值与残差图以及不同人口子群的概率曲线,可视化模型预测结果。
  • 使用独立数据集验证最终模型,并通过预测概率与实际概率的对比评估校准度。

实验结果

研究问题

  • RQ1在奥约州,哪些社会经济因素——年龄、性别或就业状况——与HIV/AIDS传播显著相关?
  • RQ2HIV感染风险在不同年龄组和就业状况之间如何变化?
  • RQ3当在分类HIV数据上应用自助重抽样法时,逻辑回归模型的预测准确性和稳定性如何?
  • RQ4在各年龄组中,就业与非就业男性和女性的HIV感染预测概率有何差异?
  • RQ5该模型在重抽样下性能是否保持稳健,表明其在公共卫生预测中的可靠性?

主要发现

  • 采用自助重抽样法的逻辑回归模型显示,年龄、就业状况和性别是HIV感染的显著预测因子(p < 0.05)。
  • 失业男性具有最高的HIV感染预测概率,在40岁时达到约0.6的峰值概率。
  • 就业女性表现出较低的风险特征,其在所有年龄组的预测概率均低于0.3。
  • 自助BCa置信区间证实了估计系数的稳定性,尤其在年龄和就业状况方面。
  • 残差图显示模型拟合良好,残差随机分布在零值周围,表明无明显拟合不足。
  • 模型的预测概率经过校准,通过将实际数据点叠加在预测曲线上得到验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。