[论文解读] A Cross-Level Information Transmission Network for Predicting Phenotype from New Genotype: Application to Cancer Precision Medicine
该论文提出了一种名为跨层级信息传输(CLEIT)的深度学习框架,通过中间组学层(如基因表达)对从基因型(突变)到表型(药物敏感性)的非对称信息流进行建模。通过利用对比损失进行领域自适应,并在无标签数据上进行预训练,CLEIT仅基于体细胞突变即可显著提升对抗癌药物反应的预测性能,相较于最先进方法在药物层面的皮尔逊相关系数上提升13.3%,在top-5精确率上提升5%。
An unsolved fundamental problem in biology and ecology is to predict observable traits (phenotypes) from a new genetic constitution (genotype) of an organism under environmental perturbations (e.g., drug treatment). The emergence of multiple omics data provides new opportunities but imposes great challenges in the predictive modeling of genotype-phenotype associations. Firstly, the high-dimensionality of genomics data and the lack of labeled data often make the existing supervised learning techniques less successful. Secondly, it is a challenging task to integrate heterogeneous omics data from different resources. Finally, the information transmission from DNA to phenotype involves multiple intermediate levels of RNA, protein, metabolite, etc. The higher-level features (e.g., gene expression) usually have stronger discriminative power than the lower level features (e.g., somatic mutation). To address above issues, we proposed a novel Cross-LEvel Information Transmission network (CLEIT) framework. CLEIT aims to explicitly model the asymmetrical multi-level organization of the biological system. Inspired by domain adaptation, CLEIT first learns the latent representation of high-level domain then uses it as ground-truth embedding to improve the representation learning of the low-level domain in the form of contrastive loss. In addition, we adopt a pre-training-fine-tuning approach to leveraging the unlabeled heterogeneous omics data to improve the generalizability of CLEIT. We demonstrate the effectiveness and performance boost of CLEIT in predicting anti-cancer drug sensitivity from somatic mutations via the assistance of gene expressions when compared with state-of-the-art methods.
研究动机与目标
- 为解决在环境扰动下,仅基于新基因型(体细胞突变)预测表型(如药物敏感性)的挑战。
- 克服现有方法的局限性,包括高维组学数据、标签数据稀缺以及异质数据整合问题。
- 显式建模从DNA到表型的非对称、多层级生物信息流,通过中间分子层实现。
- 通过预训练和微调整合无标签组学数据,提升在精准肿瘤学中的泛化能力和性能。
- 通过结构化、分层的深度学习框架,增强基因型-表型建模的可解释性与预测准确性。
提出的方法
- CLEIT采用跨层级架构,包含高层域(如基因表达)和低层域(如体细胞突变),建模从高层到低层的信息传输。
- 利用对比损失将低层表示与高层特征的潜在嵌入对齐,实现从更具判别性的层级中迁移知识。
- 框架通过将高层特征视为源域、低层特征视为目标域,应用领域自适应原理。
- 采用预训练-微调策略:在无标签异质组学数据上进行预训练以学习通用表征,随后在有标签药物反应数据上进行微调。
- 网络在编码器和解码器头中使用SELU激活函数、层归一化和Dropout,并共享一个回归头用于药物反应预测。
- 发送模块学习将低层特征映射到高层潜在空间,实现生物层级间结构化的信息流。
实验结果
研究问题
- RQ1基于体细胞突变数据,仅利用更高层级组学信息(如基因表达)是否能有效预测抗癌药物敏感性?
- RQ2与对称或平面架构相比,建模跨生物层级(DNA → RNA → 蛋白质 → 表型)的非对称信息传输如何提升基因型-表型预测性能?
- RQ3对比损失在对齐低层与高层表征以实现表型预测方面,相较于其他领域自适应损失(如MMD、WGAN)的优越性体现在多大程度?
- RQ4在低数据场景下,对无标签组学数据进行预训练在多大程度上提升了模型的泛化能力和性能?
- RQ5CLEIT框架是否可仅基于患者的突变谱,用于为新癌症患者推荐排名靠前的治疗方案?
主要发现
- CLEIT在预测抗癌药物敏感性方面显著优于所有基线模型,相较于最佳最先进方法DSN,在药物层面的皮尔逊相关系数上提升13.3%。
- 采用对比损失的CLEIT模型性能最高,优于基于MMD和WGAN的变体,证明了对比对齐在跨层级表征学习中的优越性。
- 在预测top-k推荐治疗方案时,CLEIT在k=5时较第二好的模型(DSN)将精确率提升约5%,表明其在精准医学中具有强大的实际应用价值。
- 消融研究证实,MLP驱动的传输函数和预训练对性能至关重要,其移除会导致准确率显著下降。
- 该模型在药物层面和样本层面的评估指标上均表现出稳健性能,验证了其在未见患者数据上的泛化能力。
- 该框架通过预训练有效利用了无标签组学数据,即使在标签药物反应数据有限的情况下,也显著增强了表征学习能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。