Skip to main content
QUICK REVIEW

[논문 리뷰] MissDAG: Causal Discovery in the Presence of Missing Data with Continuous Additive Noise Models

Erdun Gao, Ignavier Ng|arXiv (Cornell University)|2022. 05. 27.
Advanced Causal Inference Techniques인용 수 11
한 줄 요약

MissDAG는 무시할 수 있는 부재성과 가감성 잡음 모델(ANM) 하에서 완전하지 않은 데이터로부터 인과적 발견을 위한 기존의 기대최대화(EM) 기반 프레임워크이다. 이는 관측된 데이터의 가능도를 최대화함으로써 인과적 구조와 결측값을 동시에 학습하며, 합성 및 실세계 설정 모두에서 이중단계의 보정-발견 접근법보다 뛰어난 성능을 보인다.

ABSTRACT

State-of-the-art causal discovery methods usually assume that the observational data is complete. However, the missing data problem is pervasive in many practical scenarios such as clinical trials, economics, and biology. One straightforward way to address the missing data problem is first to impute the data using off-the-shelf imputation methods and then apply existing causal discovery methods. However, such a two-step method may suffer from suboptimality, as the imputation algorithm may introduce bias for modeling the underlying data distribution. In this paper, we develop a general method, which we call MissDAG, to perform causal discovery from data with incomplete observations. Focusing mainly on the assumptions of ignorable missingness and the identifiable additive noise models (ANMs), MissDAG maximizes the expected likelihood of the visible part of observations under the expectation-maximization (EM) framework. In the E-step, in cases where computing the posterior distributions of parameters in closed-form is not feasible, Monte Carlo EM is leveraged to approximate the likelihood. In the M-step, MissDAG leverages the density transformation to model the noise distributions with simpler and specific formulations by virtue of the ANMs and uses a likelihood-based causal discovery algorithm with directed acyclic graph constraint. We demonstrate the flexibility of MissDAG for incorporating various causal discovery algorithms and its efficacy through extensive simulations and real data experiments.

연구 동기 및 목표

  • 실제 응용 분야(예: 임상 시험, 경제학)에서 자주 위반되는 완전한 데이터를 전제로 하는 기존 인과적 발견 방법의 한계를 해결한다.
  • 보정 후 발견의 두 단계 접근법이 보정과 구조 학습 간 목표 불일치로 인해 비최적화될 수 있는 문제를 해결한다.
  • 무시할 수 있는 부재성과 식별 가능한 ANM 하에서 인과적 발견과 결측 데이터 처리를 통합한 통합 프레임워크를 개발한다.
  • 일관된 EM 기반 최적화 프레임워크 내에서 다양한 점수 기반 인과적 발견 알고리즘을 활용할 수 있도록 한다.
  • 연속형 가감성 잡음 모델 하에서 인과적 구조의 식별 가능성을 보장한다. 이는 선형 비정규, 동일 분산을 가진 선형 정규, 비선형 ANM 포함

제안 방법

  • ANM 가정 하에서 관측된 데이터의 기대 가능도를 최대화하는 방식으로 결측 데이터 하에서의 인과적 발견을 EM 알고리즘으로 공식화한다.
  • 결측 항목에 대한 폐쇄형 사후분포가 계산이 불가능할 경우 E단계에서 몬테카를로 EM(MCEM)을 사용하여 가능도를 근사한다.
  • M단계에서 밀도 변환 기법을 활용하여 ANM에서 유도된 간단하고 특정한 형태의 잡음 분포를 모델링함으로써 처리 용이성을 향상시킨다.
  • DAG 제약 조건을 갖춘 점수 기반 인과적 발견 알고리즘을 EM 프레임워크에 통합하여 민감하고 원칙적인 구조 학습을 가능하게 한다.
  • 연속 최적화(예: NOTEARS 스타일 제약 조건 사용)를 통해 DAG 제약 조건을 적용하여 학습된 그래프가 사이클을 포함하지 않도록 보장한다.
  • 식별 가능한 ANM(예: LiNGAM, LGM-EV)과 비식별 가능한 경우(예: 이질 분산을 가진 선형 정규)를 모두 처리하기 위해 마르코프 동치 클래스를 다룬다.

실험 결과

연구 질문

  • RQ1결측 데이터 하에서 이중단계의 보정-발견 접근법보다 통합 가능도 기반 프레임워크가 인과적 발견에서 더 나은 성능을 보일 수 있는가?
  • RQ2데이터가 완전히 무작위로 부재(MCAR) 또는 무작위로 부재(MAR)할 경우 MissDAG는 진정한 인과적 구조를 얼마나 잘 복원하는가?
  • RQ3다양한 유형의 ANM(선형 비정규, 비선형, 동일 분산을 가진 정규) 하에서 MissDAG는 결측성 조건에서도 정확도를 어느 정도 유지하는가?
  • RQ4고부재율에 대한 구조 학습 정확도와 강인성 측면에서 MissDAG는 기존 방법과 어떻게 비교되는가?
  • RQ5MissDAG는 핵심 프레임워크를 재설계하지 않고도 다양한 점수 기반 인과적 발견 알고리즘을 유연하게 통합할 수 있는가?

주요 결과

  • MissDAG는 특히 고부재율 조건에서 이중단계 방법(예: 가우시안-EM으로 보정한 후 인과적 발견 적용)보다 정확한 DAG 구조 복원에서 뚜렷한 성능 향상을 보였다.
  • 시뮬레이션 결과, MissDAG는 비선형 및 선형 비정규 모델을 포함한 모든 테스트된 ANM 유형에서 기준 방법보다 높은 구조적 해밍 거리(SHD) 정확도를 달성했다.
  • Asia 및 Alarm 네트워크와 같은 실세계 데이터셋에서도 뛰어난 성능을 유지하여 실세계의 부재 패턴에 대한 강인성을 입증했다.
  • MissDAG는 보정 우선 접근법보다 관측된 데이터에 대해 더 높은 가능도를 기록하여 진정한 데이터 생성 과정과의 일치도가 더 높다는 것을 시사한다.
  • MCEM의 통합은 계산이 불가능한 사후분포를 효과적으로 처리할 수 있게 하여, 폐쇄형 해가 없는 복잡한 모델에 대해서도 확장 가능한 프레임워크를 제공한다.
  • 이 프레임워크는 확장성이 뛰어나 고급 인과적 발견 알고리즘(예: 로그디터미낸트 항목 또는 간섭 제약 조건을 포함한 알고리즘)을 통합하기 위해 유연하게 변형할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.