[论文解读] Learning Genomic Representations to Predict Clinical Outcomes in Cancer
本文提出一种深度学习框架,利用堆叠去噪自编码器从高维癌症数据中学习基因组表征,随后通过Cox部分似然进行微调以实现生存预测。该方法在《癌症基因组图谱》的脑肿瘤数据上,使用ReLU激活函数时,相较于弹性网络Cox回归和随机生存森林,显著提升了一致性指数(CI),绝对提升达5%。
Genomics are rapidly transforming medical practice and basic biomedical research, providing insights into disease mechanisms and improving therapeutic strategies, particularly in cancer. The ability to predict the future course of a patient's disease from high-dimensional genomic profiling will be essential in realizing the promise of genomic medicine, but presents significant challenges for state-of-the-art survival analysis methods. In this abstract we present an investigation in learning genomic representations with neural networks to predict patient survival in cancer. We demonstrate the advantages of this approach over existing survival analysis methods using brain tumor data.
研究动机与目标
- 解决在癌症高维基因组谱型中预测患者生存的挑战,其中通常仅使用少数几个变量进行预后评估。
- 探索通过深度神经网络进行表征学习,是否能从当前临床亚型分类未使用的基因组变量中提取潜在的预后信号。
- 开发一种联合学习基因组表征并优化时间至事件结果的生存预测模型,采用反向传播训练。
- 评估基于深度学习的生存模型性能,与弹性网络正则化Cox回归和随机生存森林等成熟方法进行对比。
提出的方法
- 利用堆叠去噪自编码器从183维基因组特征中预训练低维表征,学习到鲁棒且压缩的表征。
- 通过反向传播Cox部分对数似然函数的梯度,对学习到的表征进行微调,以优化生存预测。
- 在微调阶段使用Cox部分似然函数(公式2)作为损失函数,梯度通过公式(5)计算,实现端到端训练。
- 由于训练数据有限,采用贝叶斯优化并结合高斯先验,高效搜索超参数空间(如学习率、网络深度、激活函数)。
- 采用10折交叉验证并结合数据打乱,评估泛化性能,每折使用70%训练集、15%验证集和15%测试集。
- 使用一致性指数(CI)衡量模型性能,该指标衡量预测与实际生存时间之间的等级相关性。
实验结果
研究问题
- RQ1深度神经网络能否有效学习有意义的基因组表征,从而在高维癌症基因组学中超越传统方法提升生存预测性能?
- RQ2通过自编码器进行表征学习,与使用弹性网络Cox回归等标准生存分析技术的直接生存建模相比,表现如何?
- RQ3使用Cox部分似然对预训练自编码器进行微调,是否能带来优于从零开始训练或使用简单模型的预后性能?
- RQ4在小样本、高维设置下,不同神经网络架构和激活函数(如ReLU与Sigmoid)对生存预测准确率有何影响?
主要发现
- 当使用ReLU激活函数时,所提出的生存神经网络相较于弹性网络正则化Cox回归,一致性指数(CI)绝对提升了5%。
- 使用Sigmoid激活函数时,神经网络相较同一基线提升了3%的CI,表明在不同激活函数下均表现出一致的性能增益。
- 随机生存森林在高维基因组数据上表现显著较差,表明其在该情境下对这类数据的可扩展性和适应性有限。
- 浅层网络(两层全连接层,每层250个神经元)优于更深的架构,可能由于训练样本有限(n=628)且标签稀缺。
- 贝叶斯优化实现了高效的超参数调优,最优设置包括预训练阶段学习率为0.001,微调阶段为0.0009。
- 模型在10次交叉验证运行中的平均CI表现出稳定且可泛化的性能,误差棒显示结果方差较低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。