Skip to main content
QUICK REVIEW

[论文解读] Estimating causal structure using conditional DAG models

Chris J. Oates, Jim Q. Smith|arXiv (Cornell University)|Nov 11, 2014
Bayesian Modeling and Causal Inference参考文献 59被引用 14
一句话总结

本文提出了条件DAG(CDAG),一类有向无环图模型,明确区分了科学关注的主要变量(primary variables)与已知原因的次要变量(secondary variables)。通过利用已知的从次要变量到主要变量的因果关系,CDAG能够从观测数据中识别主要变量之间的因果关系,其基于评分的估计方法在模拟实验和《癌症基因组图谱》(The Cancer Genome Atlas)的蛋白质组学数据中表现出一致且优于标准DAG方法的性能。

ABSTRACT

This paper considers inference of causal structure in a class of graphical models called "conditional DAGs". These are directed acyclic graph (DAG) models with two kinds of variables, primary and secondary. The secondary variables are used to aid in estimation of causal relationships between the primary variables. We give causal semantics for this model class and prove that, under certain assumptions, the direction of causal influence is identifiable from the joint observational distribution of the primary and secondary variables. A score-based approach is developed for estimation of causal structure using these models and consistency results are established. Empirical results demonstrate gains compared with formulations that treat all variables on an equal footing, or that ignore secondary variables. The methodology is motivated by applications in molecular biology and is illustrated here using simulated data and in an analysis of proteomic data from the Cancer Genome Atlas.

研究动机与目标

  • 解决在已知部分因果关系(如mRNA → 蛋白质)而其他关系未知且为主要关注对象的场景下,因果结构估计的挑战。
  • 形式化一类图形模型——条件DAG(CDAG),明确将次要变量作为主要变量的已知原因纳入模型。
  • 建立在引入次要变量时,主要变量之间因果影响方向可识别的条件。
  • 开发一种基于评分的CDAG结构估计方法,其渐近一致性不依赖于次要变量之间的独立性。
  • 通过实证结果表明,考虑次要变量可显著提升因果结构恢复的准确性,优于仅对主要变量应用标准DAG模型的方法。

提出的方法

  • 将CDAG定义为包含两类节点的DAG:主要变量(Y_i)和次要变量(X_i),其中每个主要变量通过双射φ: V → W,拥有一个已知的直接原因来自次要变量。
  • 为CDAG赋予因果语义,使得已知的X_i → Y_φ(i)边能够识别原本在主要图中不可识别的Y_i → Y_j边。
  • 提出一种基于评分的CDAG结构估计器,采用惩罚似然或BIC型评分,以反映CDAG模型下的条件独立结构。
  • 在正则性条件下,证明基于评分的估计器具有渐近一致性,即使次要变量之间存在依赖关系。
  • 通过模拟研究和《癌症基因组图谱》(TCGA)的真实蛋白质组学数据,评估其性能相对于标准DAG估计器的表现。
  • 将该方法应用于BRCA样癌症亚型,以总蛋白水平作为次要变量,磷酸化蛋白作为主要变量。

实验结果

研究问题

  • RQ1已知的次要变量与主要变量之间的因果关系是否能改善主要变量之间因果结构的可识别性?
  • RQ2在模型中包含次要变量时,主要变量之间因果影响方向在何种条件下可识别?
  • RQ3当忽略次要变量或将其视为对称处理时,基于CDAG的因果结构估计性能与基于标准DAG的方法相比如何?
  • RQ4在真实分子数据中,CDAG是否能比标准DAG更准确地恢复已知的生物因果通路(如p-MEK → p-MAPK)?
  • RQ5包含次要变量是否会导致更密集、更具生物学合理性的因果网络,相较于标准DAG?

主要发现

  • CDAG模型能够在每个Y_i均有一个已知的次要变量X_i作为直接原因的前提下,从未观测数据中识别主要变量之间的因果边(Y_i → Y_j)。
  • 基于评分的CDAG结构估计器即使在次要变量存在依赖关系时也具有渐近一致性,放宽了工具变量方法中常见的独立性假设。
  • 在模拟实验中,CDAG估计在结构准确性方面优于标准DAG估计,尤其在恢复真实因果边方面表现更优。
  • 在TCGA蛋白质组学数据的分析中,CDAG模型正确恢复了如p-MEK → p-MAPK等已知的生物通路方向,而标准DAG常出现边方向反转。
  • 估计的CDAG结构比标准DAG更密集,表明次要变量能够揭示先前未被检测到或存在歧义的因果关系。
  • 该方法在分子生物学中展现出实际应用价值,通过将总蛋白水平作为工具变量,有效推断磷酸化蛋白之间的因果关系。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。