Skip to main content
QUICK REVIEW

[논문 리뷰] DoWhy: An End-to-End Library for Causal Inference

Amit Sharma, Emre Kıcıman|arXiv (Cornell University)|2020. 11. 09.
Advanced Causal Inference Techniques참고 문헌 5인용 수 15
한 줄 요약

DoWhy는 인과 추론을 위한 오픈소스 엔드 투 엔드 파이썬 라이브러리로, 인과 분석을 네 가지 통합된 단계인 모델, 식별, 추정, 정밀검증으로 체계화한다. 비전문가가 그래픽 모델과 do-계산법을 사용해 인과 모델을 구축하고, EconML 및 CausalML와의 통합을 포함한 다양한 통계적 방법으로 인과 효과를 추정하며, 자동으로 정밀검증 방법을 통해 신뢰성과 접근성을 크게 향상시킨다. 데이터 과학 분야에서의 인과 추론을 개선한다.

ABSTRACT

In addition to efficient statistical estimators of a treatment's effect, successful application of causal inference requires specifying assumptions about the mechanisms underlying observed data and testing whether they are valid, and to what extent. However, most libraries for causal inference focus only on the task of providing powerful statistical estimators. We describe DoWhy, an open-source Python library that is built with causal assumptions as its first-class citizens, based on the formal framework of causal graphs to specify and test causal assumptions. DoWhy presents an API for the four steps common to any causal analysis---1) modeling the data using a causal graph and structural assumptions, 2) identifying whether the desired effect is estimable under the causal model, 3) estimating the effect using statistical estimators, and finally 4) refuting the obtained estimate through robustness checks and sensitivity analyses. In particular, DoWhy implements a number of robustness checks including placebo tests, bootstrap tests, and tests for unoberved confounding. DoWhy is an extensible library that supports interoperability with other implementations, such as EconML and CausalML for the the estimation step. The library is available at https://github.com/microsoft/dowhy

연구 동기 및 목표

  • 데이터 과학 분야에서 인과 모델링에 익숙하지 않은 사용자에게도 체계적이고 사용자 友好的인 인과 추론 프레임워크가 부족한 문제를 해결하기 위해.
  • 인과 그래프 기반 접근을 통해 모델링 가정을 명시적이고 검증 가능한 방식으로 만들음으로써 인과 추론의 진입 장벽을 낮추기 위해.
  • 그래픽 모델과 잠재적 결과 프레임워크를 통합한 통일된 인터페이스를 제공하여 다양한 추정 방법을 지원하기 위해.
  • 정밀검증 기법을 통해 자동으로 강건성 검사를 수행함으로써 사용자가 검증되지 않은 가정에 대해 인과 추정치를 검증할 수 있도록 하기 위해.
  • 이론적 인과 추론과 실무 적용 사이의 격차를 해소하기 위해 확장 가능하고 상호 운용이 가능하며 오픈소스인 도구를 제공하기 위해.

제안 방법

  • 라이브러리는 네 가지 핵심 단계인 모델(사전 지식을 인과 그래프로 형식화), 식별(do-계산법과 그래프 기반 기준을 사용해 추정량을 찾기), 추정(정확도가 높은 통계 추정기 포함, EconML 및 CausalML에서의 통합 포함), 정밀검증(다양한 정밀검증 방법을 통해 강건성 테스트)으로 구성되어 있다.
  • 그래픽 모델과 do-계산법을 사용해 인과 가정을 인코딩하고 검증함으로써 모든 모델링 결정이 명시적이고 분석 가능하도록 보장한다.
  • 식별 단계는 배경 조절, 전방 통로, 도구 변수, 중재 기반 추정량 등 다양한 기준을 지원한다.
  • 추정은 비모수적 및 모수적 방법을 모두 활용하며, 성향 스코어 분할, 역확률 가중치, EconML를 통한 이중 기계학습 기반 추정기 등이 포함된다.
  • 정밀검증 방법으로는 위약 치료, 위약 결과, 무작위 공통 원인, 관측되지 않은 혼란 요인 시뮬레이션, 데이터 서브셋 검증, 부트스트랩 검증 등이 포함되어 있으며, 모델링, 식별, 추정 단계 전반에 걸쳐 강건성 테스트를 수행한다.
  • 라이브러리는 확장 가능하도록 설계되어 있으며, 네 단계를 별도로 개발하고 조합할 수 있도록 하며, 기존 통계 및 머신러닝 라이브러리와의 통합을 지원한다.

실험 결과

연구 질문

  • RQ1인과 모델링에 깊은 전문 지식이 없는 데이터 과학자들이 어떻게 인과 추론을 쉽게 접근할 수 있는가?
  • RQ2모델링, 식별, 추정, 정밀검증이라는 인과 분석의 네 핵심 단계를 하나의 워크플로우로 통합할 수 있는 체계적 프레임워크는 무엇인가?
  • RQ3기본 진실이 없는 상황에서 자동 정밀검증 방법이 인과 추정치에 대한 신뢰도를 어떻게 향상시킬 수 있는가?
  • RQ4라이브러리가 인과 모델링 및 추정에서 검증되지 않은 가정으로 인한 오류를 어느 정도 줄일 수 있는가?
  • RQ5기존 머신러닝 및 경제학 라이브러리와 상호 운용 가능한 인과 추론 도구는 어떻게 설계할 수 있는가?

주요 결과

  • DoWhy는 원칙적이고 네 단계로 구성된 프레임워크를 제공하여 인과 모델링, 식별, 추정, 정밀검증을 명시적이고 체계적으로 만들며, 비체계적인 가정에 대한 의존도를 줄인다.
  • 백드롭, 프론트도어, 도구 변수, 중재 기반 등 다양한 식별 기준을 지원하여 다양한 데이터 시나리오에서의 민첩한 인과 분석을 가능하게 한다.
  • EconML 및 CausalML와의 통합을 통해 이중 기계학습 등의 고급 추정기를 사용할 수 있게 되어 고차원적 혼란 요인에 대해 성능을 향상시킨다.
  • 위약 치료 및 무작위 공통 원인 테스트를 포함한 자동 정밀검증 방법은 허위 효과를 효과적으로 탐지하고 추정된 인과 효과의 강건성을 검증하는 데 성공했다.
  • 라이브러리의 설계는 각 단계를 모듈러하게 확장할 수 있도록 하여 연구자와 실무자가 새로운 모델, 추정기, 정밀검증 기법을 별도로 통합할 수 있도록 한다.
  • DoWhy는 2300개 이상의 GitHub 스타와 31명의 기여자를 확보하며 산업계와 학계에서 넓은 보급을 이뤘으며, 강력한 커뮤니티 참여와 실용적 유용성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.