Skip to main content
QUICK REVIEW

[论文解读] Weakly supervised causal representation learning

Johann Brehmer, Pim de Haan|arXiv (Cornell University)|Mar 30, 2022
Domain Adaptation and Few-Shot Learning被引用 13
一句话总结

本文提出了一种弱监督因果表征学习方法,通过未知且随机的干预前后成对观测数据,从像素等非结构化数据中识别因果变量与结构。该方法引入隐式潜在因果模型(ILCMs),在无需显式图结构的情况下实现稳健的梯度优化,实验证明其在合成图像数据集(包括一个机器人操作环境)上能准确识别因果结构并学习解耦表征。

ABSTRACT

Learning high-level causal representations together with a causal model from unstructured low-level data such as pixels is impossible from observational data alone. We prove under mild assumptions that this representation is however identifiable in a weakly supervised setting. This involves a dataset with paired samples before and after random, unknown interventions, but no further labels. We then introduce implicit latent causal models, variational autoencoders that represent causal variables and causal structure without having to optimize an explicit discrete graph structure. On simple image data, including a novel dataset of simulated robotic manipulation, we demonstrate that such models can reliably identify the causal structure and disentangle causal variables.

研究动机与目标

  • 解决从像素等非结构化数据中无全监督条件下学习高层因果表征的挑战。
  • 在使用干预前后成对数据的弱监督设置下,证明因果变量与结构因果模型的可识别性。
  • 开发实用且可扩展的因果表征学习方法,避免显式图优化的局限性。
  • 在图像数据上实现对因果结构与解耦变量的稳健发现,包括一个新颖的机器人操作数据集。
  • 通过解耦变量发现与图结构学习,克服因果表征学习中的鸡生蛋蛋生鸡问题。

提出的方法

  • 提出一种弱监督设置,使用成对数据 $(x, \tilde{x})$ 表示系统在未知、随机、完美干预前后的状态。
  • 提出隐式潜在因果模型(ILCMs)作为变分自编码器,其中因果结构通过解函数 $s_i(e_i; e_{\setminus i})$ 隐式编码,而非显式DAG。
  • 采用可微分的端到端训练目标,通过变分下界联合优化表征、因果结构与干预推断。
  • 使用干预编码器 $q(I|x,\tilde{x})$ 推断哪些变量被干预,实现无需标签的自监督。
  • 仅在训练后期阶段引入拓扑序约束,以稳定显式LCMs(ELCMs)的优化。
  • 当联合优化失败时,对固定DAG集合应用图搜索策略,基于验证损失选择性能最佳的图。

实验结果

研究问题

  • RQ1能否从观测数据与未知、随机干预的成对数据中唯一识别出因果变量与结构因果模型?
  • RQ2如何在无需显式离散图表示的情况下,以可微分、可扩展的方式表示与优化因果结构?
  • RQ3隐式潜在因果模型(ILCMs)是否能比具有离散图优化的显式模型实现更稳健、更稳定的因果表征学习?
  • RQ4ILCMs 在多大程度上能解耦因果因子并从像素级数据中恢复真实因果图?
  • RQ5显式潜在因果模型(ELCMs)的失败模式是什么?它们与损失景观中的局部极小值有何关联?

主要发现

  • 在温和假设下证明了理论可识别性:因果变量与机制可从干预前后成对数据中唯一识别,仅允许重标记与逐元素重参数化。
  • 显式潜在因果模型(ELCMs)对随机初始化高度敏感,在不同随机种子下结果差异显著——在某些数据集中仅三组运行中的一组成功。
  • ELCMs 常因陷入局部极小值而失败,通常学习到具有正确骨架但因果方向错误的图,停留在与真实图同马尔可夫等价类中。
  • 隐式潜在因果模型(ILCMs)在不同随机种子下均表现出稳定且稳健的性能,成功识别出合成数据集中的因果变量与结构。
  • 在机器人操作数据集 CausalCircuit 上,ILCMs 正确恢复了真实因果图,并在多次运行中实现了高解耦分数(DCI > 0.98)。
  • ILCMs 在解耦性与结构准确性方面均优于 ELCMs,证明了隐式、可微分因果结构表征的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。