[论文解读] Causal discovery for time series from multiple datasets with latent contexts
本文提出 J-PCMCI+,一种用于多变量时间序列的非参数因果发现方法,可整合具有潜在时间与空间背景的多个数据集。通过数据聚合并使用时间与空间虚拟变量来消除未观测到的背景混杂因素,该方法实现了渐近一致性,并在样本量充足且数据集数量适中时显著提升了因果发现的准确性。
Causal discovery from time series data is a typical problem setting across the sciences. Often, multiple datasets of the same system variables are available, for instance, time series of river runoff from different catchments. The local catchment systems then share certain causal parents, such as time-dependent large-scale weather over all catchments, but differ in other catchment-specific drivers, such as the altitude of the catchment. These drivers can be called temporal and spatial contexts, respectively, and are often partially unobserved. Pooling the datasets and considering the joint causal graph among system, context, and certain auxiliary variables enables us to overcome such latent confounding of system variables. In this work, we present a non-parametric time series causal discovery method, J(oint)-PCMCI+, that efficiently learns such joint causal time series graphs when both observed and latent contexts are present, including time lags. We present asymptotic consistency results and numerical experiments demonstrating the utility and limitations of the method.
研究动机与目标
- 解决在多个不同背景(例如流域)的数据集可用时,多变量时间序列因果发现中潜在混杂因素的问题。
- 克服单一数据集因果发现方法的局限性,这些方法未能考虑如大尺度天气或地形等共享的未观测背景变量。
- 将 PCMCI+ 算法扩展至联合建模系统变量、可观测背景与潜在背景混杂因素,通过引入时间与空间虚拟变量。
- 在渐近条件下实现一致的因果图估计,同时保持高查全率,并有效处理时间序列中的自相关性。
- 通过利用背景变量及其在联合图中的依赖关系,提升系统变量间因果关系的方向判断准确性。
提出的方法
- 将来自不同背景(例如河流流域)的多个时间序列数据集合并为一个联合数据集,以增加样本量。
- 引入时间虚拟变量与空间虚拟变量,分别表示潜在的时间依赖性与空间恒定混杂因素。
- 对合并后的数据应用 PCMCI+ 算法,将可观测背景变量与虚拟变量一并视为因果图的一部分。
- 使用滞后变量进行条件独立性检验,以考虑时间序列中的时间依赖性与自相关性。
- 对虚拟变量进行条件化处理,以消除未观测背景效应带来的混杂偏倚,这些效应原本会扭曲系统变量间的关系。
- 利用背景变量及其依赖关系,在马尔可夫等价性不明确时,通过撞车因子或方向判定规则来确定系统变量间因果关系的方向。

实验结果
研究问题
- RQ1当潜在时间与空间背景混杂系统变量时,跨多个时间序列数据集进行联合因果发现是否能提升因果推断能力?
- RQ2引入时间与空间虚拟变量后,其对存在未观测混杂因素时因果发现的一致性与准确性有何影响?
- RQ3该方法在有限样本下的收敛特性如何,尤其与时间序列长度和数据集数量的关系如何?
- RQ4可观测背景变量在多大程度上可帮助确定联合图中系统变量间因果关系的方向?
- RQ5在小样本量或高维虚拟变量条件下,该方法存在哪些局限性?
主要发现
- 当同时存在可观测与潜在背景变量时,J-PCMCI+ 在样本量充足的情况下实现了因果发现的渐近一致性。
- 与标准 PCMCI+ 相比,当存在潜在混杂因素时,该方法显著降低了假阳性率,尤其是在使用虚拟变量建模未观测背景时效果更明显。
- 数值实验表明,随着时间序列长度(T)增加和数据集数量(M)适中,性能持续提升,当 T 较大时真阳性率(TPR)趋近理论最大值。
- 当 T 相对于 M 较小时,存在根本性的有限样本偏差,导致因未完全去混杂而出现假阳性率膨胀,这与固定效应模型中的 Nickell 偏倚一致。
- 该方法继承了 PCMCI+ 在处理高度自相关时间序列方面的优势,保持了条件独立性检验中的高查全率。
- 使用虚拟变量虽增加了维度,但能有效去混杂潜在背景变量;然而,当模型违反较强或样本量较小时,其有效性会下降。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。