Skip to main content
QUICK REVIEW

[论文解读] Inferring Multidimensional Rates of Aging from Cross-Sectional Data

Emma Pierson, Pang Wei Koh|PubMed|Jul 12, 2018
Insurance, Mortality, Demography, Risk Management参考文献 59被引用 9
一句话总结

该论文提出了一种潜在变量模型,通过将个体表型建模为低维、线性演化的潜在状态与静态个体特异性偏差的非线性函数,从横断面数据中推断多维衰老轨迹。在有序同构非线性映射和已知时间无关变异的假设下,该模型具有可识别性,并能恢复与英国生物样本库数据集中疾病、死亡率和风险因素相关的可解释衰老速率。

ABSTRACT

Modeling how individuals evolve over time is a fundamental problem in the natural and social sciences. However, existing datasets are often <i>cross-sectional</i> with each individual observed only once, making it impossible to apply traditional time-series methods. Motivated by the study of human aging, we present an interpretable latent-variable model that learns temporal dynamics from cross-sectional data. Our model represents each individual's features over time as a nonlinear function of a low-dimensional, linearly-evolving latent state. We prove that when this nonlinear function is constrained to be <i>order-isomorphic,</i> the model family is identifiable solely from cross-sectional data provided the distribution of time-independent variation is known. On the UK Biobank human health dataset, our model reconstructs the observed data while learning interpretable rates of aging associated with diseases, mortality, and aging risk factors.

研究动机与目标

  • 解决仅从横断面数据中学习个体水平纵向动态的挑战,其中每个个体仅被测量一次。
  • 将人类衰老建模为多维过程,不同生物系统具有独立且可解释的变化速率。
  • 在温和结构假设下(特别是非线性映射的有序同构性),建立从横断面数据中识别潜在衰老模型的可识别性。
  • 将该模型应用于英国生物样本库数据集,恢复与健康结局、死亡率和风险因素相关的衰老轨迹。
  • 使用横断面数据和有限纵向数据验证模型性能,展示其鲁棒性和预测能力。

提出的方法

  • 该模型将每个人的表型向量表示为时间演化潜在状态 $ r_t $ 的非线性函数,该状态随时间线性演化,以及捕捉个体特异性变异的静态偏差向量 $ b $。
  • 从 $ r_t $ 到观测特征的非线性映射被约束为有序同构,以确保衰老进展与表型变化之间关系的单调性。
  • 在时间无关变异 $ b $ 的分布已知的假设下,证明了可识别性,从而仅从横断面数据中即可恢复潜在衰老速率。
  • 该模型采用变分自编码器框架进行训练,对单调和非单调特征分别设置独立头,通过参数化单调函数 $ f = s \circ a $ 强制实现单调性。
  • 采用混合损失函数,结合横断面重建损失与少量纵向数据,以提升泛化能力,通过超参数调优避免过拟合。
  • 通过随机种子、数据子采样和不同潜在维度的实验评估模型稳定性,结果表明衰老速率恢复一致。

实验结果

研究问题

  • RQ1我们能否仅从横断面数据中恢复出可解释的多维衰老轨迹?
  • RQ2在何种条件下,仅从横断面数据即可识别潜在衰老模型?
  • RQ3推断出的衰老速率如何与真实世界健康结局(如疾病、死亡率和风险因素)相关联?
  • RQ4该模型能否仅使用少量纵向数据配合大规模横断面数据,实现对纵向预测的良好泛化?
  • RQ5学习到的衰老速率对模型架构、数据采样和潜在维度变化的扰动有多大的鲁棒性?

主要发现

  • 该模型实现了高重建精度,在英国生物样本库数据集中,52种表型的重建特征与实际特征之间的平均相关系数达到0.88。
  • 在纵向外推方面,该模型优于基线模型,对超过5年随访的83%个体正确预测了与年龄相关的改变,而纯横断面模型仅为66%。
  • 推断出的更高衰老速率与疾病风险、死亡率以及吸烟等已知风险因素显著相关。
  • 在所有测试的扰动条件下(包括不同随机种子、数据子集和潜在维度),模型学习到的衰老速率保持稳定,相关系数 $ \rho_r > 0.8 $。
  • 当引入少量纵向数据且 $ \lambda_{\text{lon}} = 1 $ 时,纵向泛化性能最佳,有效避免过拟合并提升了预测表现。
  • 该模型成功识别出与不同生物系统(如认知功能和肺部健康)相对应的可解释衰老维度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。