[论文解读] Survival-supervised latent Dirichlet allocation models for genomic analysis of time-to-event outcomes
本文提出了一种生存监督的潜在狄利克雷分配(survLDA)模型,这是一种新颖的概率模型,通过将每位患者视为‘文档’、其分子特征视为‘词汇’,将生存结局的时间至事件数据与基因组及临床数据相结合。该方法识别出具有不同基因表达和甲基化模式的生物学上一致的患者亚群,并将其与生存结局关联,成功在《癌症基因组图谱》(TCGA)卵巢癌数据集中识别出具有临床意义生存差异的预后患者亚群。
Two challenging problems in the clinical study of cancer are the characterization of cancer subtypes and the classification of individual patients according to those subtypes. Statistical approaches addressing these problems are hampered by population heterogeneity and challenges inherent in data integration across high-dimensional, diverse covariates. We have developed a survival-supervised latent Dirichlet allocation (survLDA) modeling framework to address these concerns. LDA models have proven extremely effective at identifying themes common across large collections of text, but applications to genomics have been limited. Our framework extends LDA to the genome by considering each patient as a `document' with `text' constructed from clinical and high-dimensional genomic measurements. We then further extend the framework to allow for supervision by a time-to-event response. The model enables the efficient identification of collections of clinical and genomic features that co-occur within patient subgroups, and then characterizes each patient by those features. An application of survLDA to The Cancer Genome Atlas (TCGA) ovarian project identifies informative patient subgroups that are characterized by different propensities for exhibiting abnormal mRNA expression and methylations, corresponding to differential rates of survival from primary therapy.
研究动机与目标
- 为解决在存在人群异质性以及高维、多源的基因组和临床数据背景下,识别具有生物学意义的癌症亚型的挑战。
- 开发一种方法,将生存结局与患者间特征共现模式相结合,实现对亚群及其相关分子特征的联合识别。
- 通过将患者建模为文档、分子特征建模为词汇,将原始设计用于文本的LDA模型扩展至基因组学,并引入时间至事件结局的监督。
- 通过基于主题分布的生存风险预测,实现对患者的个体化表征,同时考虑基因组和临床变量之间的复杂相互作用。
提出的方法
- 将每位患者映射为一个‘文档’,其中词汇为基因组和临床特征,并使用潜在狄利克雷分配(LDA)在患者间发现主题——即共现的特征模式。
- 通过将主题比例与风险函数关联,利用比例风险模型对LDA进行生存监督,基于主题权重构建线性预测器。
- 采用变分期望-最大化(VEM)算法,联合估计主题分布、主题-词汇分布以及生存参数(如基线风险和回归系数)。
- 引入一个背景主题以表示常见治疗暴露(如卵巢癌中的铂类和紫杉烷类药物),固定其主题权重,并将其生存系数设为零,作为基线参考。
- 在非参数生存建模中使用Breslow估计器估计基线风险,实现对累积风险的灵活估计和生存预测。
- 通过计算新患者的后验主题分布,并将其用于生存模型,实现对中位生存期或风险比的预测。
实验结果
研究问题
- RQ1我们能否在癌症基因组学中识别出具有不同基因组和临床特征共现模式的患者亚群,并将其与差异性生存结局相关联?
- RQ2如何将时间至事件的生存数据与高维、异质性的组学及临床数据相结合,以改善患者亚群的发现?
- RQ3能否将原本为文本设计的主题模型框架有效适配至基因组学,通过将患者视为文档、分子特征视为词汇?
- RQ4所发现的主题在多大程度上反映了生物学上意义明确的分子表型(如异常mRNA表达或甲基化),并如何与生存结局相关联?
- RQ5该模型能否通过识别反映潜在生物学异质性的患者特异性主题分布,从而改善生存预测?
主要发现
- survLDA模型成功在TCGA卵巢癌数据中识别出具有mRNA表达和DNA甲基化差异模式的独立患者亚群。
- 这些亚群与显著不同的生存率相关,某些亚群的患者在初次治疗后表现出明显更高或更低的死亡风险。
- 模型揭示,富含异常甲基化及特定基因过度表达的主题与不良生存结局密切相关。
- 引入标准治疗(铂类和紫杉烷类)的背景主题,通过将生物学相关变异与治疗相关信号分离,提升了模型的可解释性。
- 该方法通过联合建模特征共现与生存结局,减少了人群异质性带来的扭曲,优于标准生存模型,在识别生物学上一致的亚群方面表现更优。
- 通过后验主题分布对新患者进行预测是可行的,可利用生存模型的风险函数估计中位生存时间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。