[论文解读] Reusability report: Prostate cancer stratification with diverse biologically-informed neural architectures
本研究验证了P-NET的可重现性与鲁棒性,这是一种用于前列腺癌分层的生物学信息深度神经网络,表明Reactome通路知识对其性能至关重要。研究进一步揭示,尽管整体准确率相似,但不同的神经网络架构——P-NET与图神经网络——会产生截然不同且持久的个体患者预测结果,凸显了临床AI模型中架构特异性偏差的存在。
In Elmarakeby et al., "Biologically informed deep neural network for prostate cancer discovery", a feedforward neural network with biologically informed, sparse connections (P-NET) was presented to model the state of prostate cancer. We verified the reproducibility of the study conducted by Elmarakeby et al., using both their original codebase, and our own re-implementation using more up-to-date libraries. We quantified the contribution of network sparsification by Reactome biological pathways, and confirmed its importance to P-NET's superior performance. Furthermore, we explored alternative neural architectures and approaches to incorporating biological information into the networks. We experimented with three types of graph neural networks on the same training data, and investigated the clinical prediction agreement between different models. Our analyses demonstrated that deep neural networks with distinct architectures make incorrect predictions for individual patient that are persistent across different initializations of a specific neural architecture. This suggests that different neural architectures are sensitive to different aspects of the data, an important yet under-explored challenge for clinical prediction tasks.
研究动机与目标
- 通过原始代码库与重构代码库,验证P-NET这一用于前列腺癌分层的生物学信息神经网络的可重现性。
- 通过比较生物学信息稀疏化与随机稀疏化,评估Reactome通路信息对模型性能的贡献。
- 在相同数据集上评估替代神经网络架构(特别是三种图神经网络)的预测性能与一致性。
- 研究不同架构之间的个体患者预测差异,重点关注模型初始化过程中的持续错误。
- 探讨在可解释机器学习用于癌症基因组学时,架构设计的临床意义。
提出的方法
- 使用PyTorch重新实现原始P-NET模型,以提升代码可重用性,并确保与现代深度学习库的可重现性。
- 在807名前列腺癌患者的相同训练集上,训练了30个随机初始化的P-NET实例以及三种GNN变体(GCN、GAT、GraphSAGE)。
- 在P-NET中使用固定的稀疏度水平,以隔离生物信息通路结构的影响,通过与随机置换的通路分配进行比较。
- 使用标准指标(AUC、AUPR、F1、精确率、召回率和准确率)在保留的102名患者的测试集上评估模型性能。
- 计算模型预测之间的相关性矩阵,以量化不同架构间的预测一致性,并分析个体患者的预测差异。
- 应用统计检验(Kolmogorov-Smirnov检验,FDR校正)以评估不同模型间预测差异的显著性。
实验结果
研究问题
- RQ1使用已发布的代码和现代PyTorch实现,原始P-NET模型在前列腺癌分层任务中是否可重现?
- RQ2在不考虑模型稀疏度的情况下,生物信息通路(如Reactome)的引入在多大程度上提升了P-NET的性能?
- RQ3在相同数据集上,具有不同归纳偏置的图神经网络(GCN、GAT、GraphSAGE)与P-NET相比,在预测转移性前列腺癌方面的表现如何?
- RQ4对于同一神经网络架构的多个权重初始化,是否存在持续存在的个体患者预测错误,表明存在架构偏差?
- RQ5不同神经网络架构在对同一患者进行预测时,其预测结果差异有多大?这对临床决策有何影响?
主要发现
- 使用PyTorch重构的P-NET成功以高保真度重现了原始结果,证实了核心模型的可重现性。
- 在保持稀疏度但去除生物结构的随机置换通路分配下,性能出现显著下降,证明生物知识是P-NET成功的关键因素。
- 图神经网络(GCN、GAT、GraphSAGE)的整体性能略低于P-NET,AUPR值为0.86 ± 0.01,而P-NET为0.89 ± 0.01。
- P-NET与GNN预测之间的相关性较低(平均皮尔逊相关系数 = 0.682),表明不同架构关注数据的不同方面。
- 在102名测试患者中,有50名患者的预测转移概率在GAT与P-NET之间差异至少10%,且该差异具有统计学显著性(FDR < 0.05)。
- 错误预测并非随机产生,而是在同一架构的多个权重初始化中持续存在,表明架构设计在临床预测中引入了系统性、非随机的偏差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。