QUICK REVIEW
[论文解读] A graph-embedded deep feedforward network for disease outcome classification and feature selection using gene expression data
Yunchuan Kong, Tianwei Yu|arXiv (Cornell University)|Jan 18, 2018
Gene expression and cancer classification参考文献 33被引用 5
一句话总结
本文提出图嵌入深度前馈网络(GEDFN),一种将基因网络拓扑结构整合到深度前馈网络中的深度学习模型,以实现稀疏、具有生物学意义的特征选择,并提升高维基因表达数据中的分类准确率。通过基于基因网络约束输入层到隐藏层的连接,GEDFN降低了过拟合风险,在乳腺癌RNA-seq数据中实现了高准确率(AUC > 0.95)和具有生物学可解释性的基因排序。
ABSTRACT
Gene expression data represents a unique challenge in predictive model building, because of the small number of samples $(n)$ compared to the huge amount of features $(p)$. This "$n<
研究动机与目标
- 解决在疾病预后预测中高维、小样本量(n<<p)的基因表达数据带来的挑战。
- 克服因样本量小和特征高度相关性导致标准深度学习在生物信息学中应用受限的问题。
- 整合外部基因网络信息,以指导稀疏、具有生物学意义的特征选择,并提升模型泛化能力。
- 开发一种利用图结构关系信息增强分类性能与可解释性的深度学习框架。
- 通过网络感知的特征选择,识别与疾病预后相关的生物相关基因模块。
提出的方法
- 提出一种图嵌入深度前馈网络(GEDFN),基于预定义的基因网络约束输入层与第一隐藏层之间的连接。
- 将基因网络作为结构先验,强制实现稀疏连接,降低模型复杂度并防止过拟合。
- 使用标准反向传播算法,结合交叉熵损失函数,对疾病预后进行二分类训练。
- 对第一隐藏层应用L2正则化,进一步促进稀疏性并提升泛化能力。
- 通过第一层中学习到的权重大小对输入特征进行排序,实现特征选择。
- 通过基因本体(GO)富集分析和社区检测,对排名靠前的基因及其网络邻居进行下游生物学解释。
实验结果
研究问题
- RQ1将基因网络拓扑结构整合到深度前馈网络中,是否能提升高维基因表达数据中的分类准确率?
- RQ2与标准深度学习或非网络化方法相比,图嵌入连接是否能带来更具生物学可解释性和相关性的特征选择?
- RQ3该模型能否仅利用基因表达数据和网络数据,识别出与疾病状态相关的已知生物通路(例如,细胞凋亡、MAPK信号通路)?
- RQ4在AUC和特征选择稳定性方面,GEDFN相较于SVM、随机森林和标准DFN等基线方法表现如何?
- RQ5GEDFN中排名靠前的基因能否形成具有生物一致性的模块,并富集于已知的疾病相关通路?
主要发现
- 在使用TCGA RNA-seq数据对ER+与ER-乳腺癌状态进行分类时,GEDFN的受试者工作特征曲线下面积(AUC)超过0.95,在模拟实验和真实数据实验中均优于基线方法。
- 按重要性排序的前5%基因在关键生物学过程中显著富集,包括细胞凋亡调控(p = 1.7e-5)、中心体定位(p = 0.00042)和MAPK级联调控(p = 0.0015)。
- 对排名靠前的基因网络进行社区检测,识别出16个功能模块,其中一个模块包含34个在ER+样本中上调和27个下调的基因,均与细胞凋亡和雌激素信号通路相关。
- GO富集分析证实,该模块中的基因显著关联于雌激素相关通路,包括ERK1/2级联和G蛋白偶联受体信号转导。
- 该模型成功识别出已知的生物学机制,如雌激素诱导的MAPK激活和PTPα介导的细胞凋亡,验证了其生物学相关性。
- 该方法在模拟数据和真实世界数据中均表现出稳健性,其可解释的特征选择结果与乳腺癌的已知分子生物学机制高度一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。