Skip to main content
QUICK REVIEW

[논문 리뷰] A Survey of Learning Causality with Data: Problems and Methods

Ruocheng Guo, Lu Cheng|arXiv (Cornell University)|2018. 09. 25.
Bayesian Modeling and Causal Inference참고 문헌 188인용 수 189
한 줄 요약

이 설문조사는 데이터로부터 인과를 학습하기 위한 전통적 및 최전선 방법들의 구조적 검토를 제공하고, SCMs 및 잠재적 결과 프레임워크를 비교하며, 인과 추론과 발견에서의 데이터 유형, 문제 및 방법을 자세히 설명하고 빅데이터 시대의 기계학습과의 연결 고리를 제시합니다.

ABSTRACT

This work considers the question of how convenient access to copious data impacts our ability to learn causal effects and relations. In what ways is learning causality in the era of big data different from -- or the same as -- the traditional one? To answer this question, this survey provides a comprehensive and structured review of both traditional and frontier methods in learning causality and relations along with the connections between causality and machine learning. This work points out on a case-by-case basis how big data facilitates, complicates, or motivates each approach.

연구 동기 및 목표

  • 빅 데이터가 전통적 설정과 비교하여 인과 효과와 인과 관계 학습을 어떻게 바꾸는지 명확히 한다.
  • 데이터 유형과 대응하는 인과 문제(효과 대 관계)를 체계적으로 분류한다.
  • 핵심 프레임워크(구조적 인과 모델과 잠재적 결과)와 그것들의 식별 및 추정 용도를 제시한다.
  • 관찰 데이터 하에서의 인과 추론과 발견에 대한 전통적 및 최전방 방법들을 조사한다.
  • 감독 학습, 도메인 적응, 강화 학습 등과 같은 기계 학습 분야와의 인과 학습 간 연결 고리를 논의한다.

제안 방법

  • 구조적 인과 모델(SCMs)과 잠재적 결과 프레임워크(POF)라는 두 가지 근본적인 인과 프레임워크를 소개한다.
  • 주요 개념을 설명한다: 인과 그래프, d-분리, 역문 제(back-door) 기준, do-계산, 개입 분포와 관찰 분포의 차이.
  • 인과 학습에 사용할 데이터를 세 가지 유형으로 분류한다: 인과 효과를 위한 데이터(혼입변수 유무, 빅데이터 고려사항 포함), 인과 관계를 위한 데이터, 시계열 설정.
  • 교란 편향을 제거하기 위한 표준 식별 전략 개요: back-door 기준을 통한 조정 및 back-door가 실패할 때의 대체 식별.
  • SCMs와 POF가 평균 처리 효과(ATE), 개별 처리 효과(ITE), 조건부 효과(CATE)를 정의하고 추정하는 데 어떻게 사용되는지 설명한다.
  • do-계산의 한계(예: 개별 수준 질문 및 반대실험(counterfactuals))를 논의하고 Pearl의 프레임워크에서 반사실 표기(counterfactual notation)를 소개한다.
  • 인과 효과/관계에 대한 실제값(ground truth)이 어떻게 얻어지는지 요약한다(무작위 실험, 시뮬레이션, 사전 지식).
  • 데이터 유형이 인과 효과 및 인과 관계 학습에 어떻게 매핑되는지 방법에 대한 지침을 제공한다.

실험 결과

연구 질문

  • RQ1빅 데이터 시대가 인과 효과와 인과 관계 학습 능력에 어떤 영향을 미치는가?
  • RQ2관찰 데이터에서 인과 효과와 인과 관계를 학습하게 하는 데이터 유형과 문제 구성은 무엇인가?
  • RQ3데이터로부터 인과 quantities를 추정하는 데 사용되는 기본 프레임워크와 식별 전략은 무엇인가?
  • RQ4인과와 기계 학습 간의 연결이 방법론적 발전에 어떻게 영향을 주는가?
  • RQ5빅데이터로 인과를 학습하는 데 남아 있는 미해결 문제는 무엇인가?

주요 결과

  • 빅 데이터는 더 풍부한 특징 세트를 통해 일부 혼란을 완화시킬 수 있지만 새로운 편향과 고차원 도전도 야기한다.
  • 인과 질문은 인과 효과 학습(추론)과 인과 관계 학습(발견)으로 나뉘며, 각각 서로 다른 데이터와 방법이 필요하다.
  • SCMs와 잠재적 결과 프레임워크는 논리적으로 동등하며 식별과 추정에 보완적 관점을 제공한다.
  • 식별은 일반적으로 back-door 보정이나 back-door 기준이 성립할 때의 다른 전략에 의존; 성립하지 않으면 대체 식별 방법이 논의된다.
  • 인과 효과의 실제값은 보통 무작위 실험이나 도메인 지식 시뮬레이션에서 얻어지며, 반사실은 추가적인 도전을 제기한다.
  • 이 설문은 인과 학습을 감독/반감감독 학습, 도메인 적응, 강화 학습과 같은 기계 학습 주제와 연결한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.