Skip to main content
QUICK REVIEW

[论文解读] Evaluating deep variational autoencoders trained on pan-cancer gene expression

Gregory P. Way, Casey S. Greene|arXiv (Cornell University)|Nov 13, 2017
Molecular Biology Techniques and Applications参考文献 19被引用 17
一句话总结

本研究评估了在泛癌RNA-seq数据(来自The Cancer Genome Atlas, TCGA)上训练的深度变分自编码器(VAEs),对比了一层和两层隐藏层VAE与PCA、ICA、NMF及ADAGE在降维方面的表现。尽管更深的VAE仅带来微小的性能提升,但VAE潜在空间揭示了具有生物学意义的模式,特别是在高级别浆液性卵巢癌(HGSC)亚型比较中,识别出与间质亚型相关的胶原蛋白分解代谢过程。

ABSTRACT

Cancer is a heterogeneous disease with diverse molecular etiologies and outcomes. The Cancer Genome Atlas (TCGA) has released a large compendium of over 10,000 tumors with RNA-seq gene expression measurements. Gene expression captures the diverse molecular profiles of tumors and can be interrogated to reveal differential pathway activations. Deep unsupervised models, including Variational Autoencoders (VAE) can be used to reveal these underlying patterns. We compare a one-hidden layer VAE to two alternative VAE architectures with increased depth. We determine the additional capacity marginally improves performance. We train and compare the three VAE architectures to other dimensionality reduction techniques including principal components analysis (PCA), independent components analysis (ICA), non-negative matrix factorization (NMF), and analysis of gene expression by denoising autoencoders (ADAGE). We compare performance in a supervised learning task predicting gene inactivation pan-cancer and in a latent space analysis of high grade serous ovarian cancer (HGSC) subtypes. We do not observe substantial differences across algorithms in the classification task. VAE latent spaces offer biological insights into HGSC subtype biology.

研究动机与目标

  • 评估随着深度增加,深度变分自编码器(VAEs)在泛癌基因表达数据上的表现。
  • 在监督和无监督任务中,将VAE与成熟的降维技术(PCA、ICA、NMF、ADAGE)进行比较。
  • 评估VAE潜在空间是否提供具有生物学意义的表征,特别是在检测高级别浆液性卵巢癌(HGSC)分子亚型方面。
  • 探究潜在空间算术在从基因表达数据中揭示疾病相关生物通路方面的实用性。

提出的方法

  • 训练了三种VAE架构:单隐藏层(Tybalt),以及具有100和300个单元的双隐藏层模型,使用Keras与TensorFlow后端。
  • 通过网格搜索调整超参数(学习率、批量大小、训练轮数、KL退火的kappa值),以最小化保留验证损失。
  • 对VAE、NMF和ADAGE使用零一归一化;对PCA和ICA使用z得分归一化,处理来自10,459个样本的TCGA RNA-seq数据(log2(FPKM+1))。
  • 通过在预测NF1失活任务中使用弹性网络逻辑回归进行5折交叉验证来评估模型性能。
  • 通过减去间质性和免疫反应性HGSC亚型的均值向量表示,执行潜在空间算术,以识别差异特征。
  • 使用基因本体论(GO)术语对减法结果中高权重基因进行通路富集分析(ORA)

实验结果

研究问题

  • RQ1VAE架构的深度增加如何影响其在捕捉泛癌基因表达中生物学相关模式方面的表现?
  • RQ2在跨癌症类型预测NF1失活方面,VAE与传统降维方法(PCA、ICA、NMF、ADAGE)相比表现如何?
  • RQ3VAE中的潜在空间算术能否揭示高级别浆液性卵巢癌(HGSC)亚型之间的生物学意义差异?
  • RQ4在间质性和免疫反应性HGSC亚型之间,VAE潜在空间中哪些生物通路表现出最强的差异?

主要发现

  • 更深的VAE架构(双隐藏层)相较于单隐藏层的Tybalt模型仅带来微小的性能提升,验证损失的增益极为有限。
  • 在预测泛癌NF1失活方面,原始基因表达特征表现最佳(AUROC = 68.4%),其次是PCA(AUROC = 65.6%),而VAE的表现与其它降维方法相当。
  • 随机基因表达控制数据集的AUROC为55.4%,表明在分类任务中可能存在因样本量过小导致的潜在偏差。
  • 基于VAE的潜在空间,特别是Tybalt和300单元双隐藏层VAE,识别出'胶原蛋白分解代谢过程'为HGSC亚型比较中最显著富集的GO术语(p = 1.8e-09 和 1.7e-03,分别)。
  • 线性方法(PCA、ICA、NMF)在通路富集方面表现有限或无显著富集,其中NMF仅识别出'同型细胞粘附'(p = 3.3e-06)为唯一显著术语。
  • ADAGE和ICA在ORA分析中均未识别出任何显著通路,凸显了非线性VAE表征所提供的独特生物学洞察。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。