[论文解读] Bayesian Semiparametric Estimation of Cancer-Specific Age-at-Onset Penetrance With Application to Li-Fraumeni Syndrome
本文提出了一种贝叶斯半参数竞争风险模型,用于估计李-弗劳梅尼综合征中癌症特异性发病年龄的易感性,同时考虑家族结构、缺失基因型数据和选择性偏倚。该方法使用伯恩斯坦多项式实现基线风险的灵活估计,并采用家庭全似然与伽马脆弱性模型,在一个包含186个家族的大型长期随访队列中,相较于参数模型,表现出更优的拟合效果和预测性能。
Penetrance, which plays a key role in genetic research, is defined as the proportion of individuals with the genetic variants (i.e., genotype) that cause a particular trait and who have clinical symptoms of the trait (i.e., phenotype). We propose a Bayesian semiparametric approach to estimate the cancer-specific age-at-onset penetrance in the presence of the competing risk of multiple cancers. We employ a Bayesian semiparametric competing risk model to model the duration until individuals in a high-risk group develop different cancers, and accommodate family data using family-wise likelihoods. We tackle the ascertainment bias arising when family data are collected through probands in a high-risk population in which disease cases are more likely to be observed. We apply the proposed method to a cohort of 186 families with Li-Fraumeni syndrome identified through probands with sarcoma treated at MD Anderson Cancer Center from 1944 to 1982. Supplementary materials for this article are available online.
研究动机与目标
- 估计李-弗劳梅尼综合征(LFS)中在多种癌症竞争风险下的癌症特异性发病年龄易感性。
- 解决通过高危人群中早期发病的肉瘤先证者进行抽样所导致的选择性偏倚。
- 使用家庭全似然与脆弱性模型,对存在缺失基因型信息的家族数据进行建模。
- 开发一种灵活的非参数基线风险估计方法,以提高模型拟合度与预测准确性。
- 为TP53突变携带者提供可靠的易感性估计,用于个性化风险评估。
提出的方法
- 使用基于伯恩斯坦多项式的贝叶斯半参数竞争风险模型,非参数化估计基线风险函数。
- 引入伽马脆弱性以考虑癌症发病年龄在家族内的相关性。
- 采用家庭全似然方法,对未观察到的基因型进行积分,并充分利用完整的家系信息。
- 应用马尔可夫链蒙特卡洛(MCMC)抽样结合数据增广法,处理缺失基因型数据并估计后验分布。
- 通过条件于先证者肉瘤诊断的校正选择性偏倚的似然函数,实现对选择性偏倚的校正。
- 使用伪边际似然(PsML)和偏差信息准则(DIC)进行模型比较与选择。
实验结果
研究问题
- RQ1在高危遗传队列中,如何在存在竞争风险的情况下估计特定癌症的发病年龄易感性?
- RQ2当数据通过早期发病肉瘤先证者收集时,选择性偏倚对易感性估计有何影响?
- RQ3整合家族结构与缺失基因型数据如何影响易感性估计的准确性和精确性?
- RQ4在指数分布、威布尔分布、分段恒定分布与伯恩斯坦多项式基线风险模型中,哪一种模型能提供最佳拟合与预测性能?
- RQ5引入脆弱性项在多大程度上改善了模型拟合度,表明家族内存在相关性?
主要发现
- 所提出的基于伯恩斯坦多项式的模型在DIC(2983.7)最低且PsML(-1499.689)最高,表明其在拟合度与预测能力方面优于指数分布、威布尔分布与分段恒定分布模型。
- 引入伽马脆弱性仅略微改善了模型拟合度,表明家族内相关性较弱,与脆弱性分布中估计的较大方差成分(ν)一致。
- 易感性估计对先验分布的敏感性较低,结果在γm,k与νk采用平坦先验、弱信息先验及中等信息先验下均保持稳定。
- 该模型有效校正了选择性偏倚,使从富含肉瘤先证者的队列中实现无偏推断成为可能。
- 通过家庭全似然方法对所有可能的基因型进行积分,成功处理了缺失基因型数据,最大限度地利用了扩展家系的信息。
- 该方法在模型拟合与预测性能方面均优于替代模型,经交叉验证的ROC曲线与模型比较指标验证了其优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。