Skip to main content
QUICK REVIEW

[论文解读] Neural Decomposition: Functional ANOVA with Variational Autoencoders

Kaspar Märtens, Christopher Yau|arXiv (Cornell University)|Jun 25, 2020
Explainable Artificial Intelligence (XAI)参考文献 23被引用 1
一句话总结

本文提出神经分解(Neural Decomposition)方法,将功能 ANOVA 方差分解整合到条件变分自编码器(CVAEs)中,实现对数据变异的可解释性、特征级别的分解,包括潜在变量(z)和协变量(c)的主效应及其非线性交互作用。通过在解码器的权重空间施加功能性约束,该方法实现了可识别性,并在高维数据中实现了可扩展的非线性方差归因,已在单细胞基因组学数据上得到有效验证,相较于线性模型具有更高的鲁棒性。

ABSTRACT

Variational Autoencoders (VAEs) have become a popular approach for dimensionality reduction. However, despite their ability to identify latent low-dimensional structures embedded within high-dimensional data, these latent representations are typically hard to interpret on their own. Due to the black-box nature of VAEs, their utility for healthcare and genomics applications has been limited. In this paper, we focus on characterising the sources of variation in Conditional VAEs. Our goal is to provide a feature-level variance decomposition, i.e. to decompose variation in the data by separating out the marginal additive effects of latent variables z and fixed inputs c from their non-linear interactions. We propose to achieve this through what we call Neural Decomposition - an adaptation of the well-known concept of functional ANOVA variance decomposition from classical statistics to deep learning models. We show how identifiability can be achieved by training models subject to constraints on the marginal properties of the decoder networks. We demonstrate the utility of our Neural Decomposition on a series of synthetic examples as well as high-dimensional genomics data.

研究动机与目标

  • 为解决变分自编码器(VAEs)在医疗和基因组学领域中的可解释性差距,特别是在黑箱潜在表征限制了对特征级变异理解的情况下。
  • 通过将潜在变量(z)和协变量(c)的可加效应与交互效应嵌入 CVAE 解码器架构中,将经典功能 ANOVA(fANOVA)扩展至深度学习。
  • 通过在权重空间中施加功能性约束,约束解码器网络的边际属性,以强制实现方差分量(主效应与交互效应)的可识别性。
  • 提供一种可扩展的非线性替代方案,用于分解单细胞 RNA-seq 数据中的基因表达变异,降低模型误设的风险。
  • 证明在树突状细胞数据中,基因表达的非线性交互效应可被准确捕捉并归因于伪时间与刺激类型。

提出的方法

  • 提出一种基于 CVAE 的神经分解框架,其中解码器被设计为显式建模潜在变量(z)和固定协变量(c)的可加效应,以及其非线性交互作用。
  • 在解码器的权重空间施加功能性约束,以确保可识别性,防止某一成分吸收其他成分的变异。
  • 在训练过程中采用约束优化,以保持解码器的边际属性(如主效应的零均值激活),从而分离方差贡献。
  • 采用近似后验分布的变分推断方法,支持在大规模数据集(如单细胞基因组学数据)上的可扩展训练。
  • 在解码器中采用深层神经网络架构,将输出分解为不同组件:f(z)、f(c) 和 f(z,c),其中交互项共享表示。
  • 使用合成数据和来自小鼠树突状细胞的真实单细胞 RNA-seq 数据验证该方法,其中伪时间被推断为潜在变量 z。

实验结果

研究问题

  • RQ1功能 ANOVA 分解能否被有效适配至 CVAE 等深度生成模型中,以实现在高维数据中的可解释方差归因?
  • RQ2如何在不牺牲建模灵活性的前提下,在基于神经网络的解码器中强制实现主效应与交互效应的可识别性?
  • RQ3所提出的非线性分解方法是否在捕捉高噪声单细胞基因组学数据中的真实生物变异方面优于线性模型?
  • RQ4神经分解在多大程度上能准确分离并量化伪时间(z)、刺激类型(c)及其交互作用对基因表达变异的贡献?
  • RQ5该方法能否在传统线性模型可能因模型误设而失效的单细胞数据中,稳健地识别出具有生物意义的交互效应?

主要发现

  • 神经分解成功地将单细胞 RNA-seq 数据中的基因表达变异分解为不同成分:伪时间(z)的主效应、刺激类型(c)的主效应,以及非线性交互效应(z,c),并量化了各成分的方差占比。
  • 该方法确认了在三个关键基因(Tnf、Rasgefb1 和 Tnfaip3)中存在显著的交互效应,这些基因的表达模式此前已通过线性模型检测到,现通过更具弹性的非线性框架得到验证。
  • 推断出的潜在维度(z)与捕获时间显著相关,证实其在树突状细胞分化过程中作为伪时间的有效代理。
  • 具有强 z 主效应的基因在 UMAP 可视化中呈现混合聚类,而具有强 c 效应或交互效应的基因则在 LPS 和 PAM 刺激细胞之间表现出清晰的分离,表明生物信号被正确归因。
  • 非线性模型在方差分解方面比先前的线性方法更准确、更鲁棒,降低了在高噪声单细胞数据中因模型误设导致的假阳性风险。
  • 约束优化方法成功维持了可识别性,确保每个分量(z、c、交互项)均捕获了独立的变异来源,无冗余。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。