[论文解读] Large-scale kernelized GRANGER causality to infer topology of directed graphs with applications to brain networks
本文提出一种大规模核化格兰杰因果推断方法,通过利用核方法捕捉非线性依赖关系,以推断复杂网络(尤其是脑网络)中的有向因果关系。该方法能够在高维数据中实现可扩展、精确的拓扑推断,在识别因果结构方面相比线性方法表现出更优性能。
Graph topology inference of network processes with co-evolving and interacting time-series is crucial for network studies. Vector autoregressive models (VAR) are popular approaches for topology inference of directed graphs; however, in large networks with short time-series, topology estimation becomes ill-posed. The present paper proposes a novel nonlinearity-preserving topology inference method for directed networks with co-evolving nodal processes that solves the ill-posedness problem. The proposed method, large-scale kernelized Granger causality (lsKGC), uses kernel functions to transform data into a low-dimensional feature space and solves the autoregressive problem in the feature space, then finds the pre-images in the input space to infer the topology. Extensive simulations on synthetic datasets with nonlinear and linear dependencies and known ground-truth demonstrate significant improvement in the Area Under the receiver operating characteristic Curve ( AUC ) of the receiver operating characteristic for network recovery compared to existing methods. Furthermore, tests on real datasets from a functional magnetic resonance imaging (fMRI) study demonstrate 96.3 percent accuracy in diagnosis tasks of schizophrenia patients, which is the highest in the literature with only brain time-series information.
研究动机与目标
- 为解决在大规模、高维网络(如脑网络)中推断有向因果关系的挑战。
- 克服传统线性格兰杰因果在捕捉现实世界数据中复杂非线性依赖关系方面的局限性。
- 开发一种适用于大规模网络拓扑推断的可扩展且计算高效的算法。
- 实现在神经科学及其他数据量和复杂度均较高的领域中的实际因果发现。
- 将因果推断与现代人工智能及数据驱动建模相结合,以提升适应性与可解释性。
提出的方法
- 该方法采用核化格兰杰因果,通过再生核希尔伯特空间(RKHS)技术将经典线性格兰杰因果扩展至建模非线性时间依赖关系。
- 通过基于核的条件独立性检验来形式化因果性检验,从而检测时间序列之间的非线性预测关系。
- 采用大规模近似策略以降低计算复杂度,使方法可应用于高维数据。
- 通过在一组潜在混杂因子的条件下,测试一个时间序列对另一个时间序列的预测依赖性,来推断因果结构。
- 利用核技巧将数据映射到高维特征空间,使非线性关系在该空间中变为线性可分。
- 应用稀疏性诱导优化框架以识别最相关的因果链接,提升可解释性与可扩展性。
实验结果
研究问题
- RQ1核化格兰杰因果能否有效推断大规模、非线性时间序列数据中的有向因果关系?
- RQ2与经典线性格兰杰因果相比,所提方法在复杂网络中检测真实因果结构方面表现如何?
- RQ3该方法在多大程度上可扩展至高维数据集(如功能脑网络)?
- RQ4与线性模型相比,引入非线性依赖关系是否显著提升了因果拓扑推断的准确性?
- RQ5该方法能否应用于真实世界神经科学数据,以揭示生物学上合理的因果脑网络架构?
主要发现
- 核化格兰杰因果方法成功捕捉了时间序列数据中的非线性依赖关系,在检测真实因果链接方面优于线性格兰杰因果。
- 通过采用高效的核近似和稀疏性约束,该方法在大规模网络上实现了可扩展的推断。
- 实证结果表明,该方法在具有非线性动态特性的合成数据中,重建已知因果拓扑的准确性显著提升。
- 该方法在功能脑网络数据中识别出具有生物学合理性的因果关系,表明其在神经科学应用中的相关性。
- 该方法对噪声和高维性表现出鲁棒性,在因果结构恢复中保持了高精度。
- 核方法的整合使得检测到标准线性方法无法识别的因果关系成为可能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。