Skip to main content
QUICK REVIEW

[논문 리뷰] On the multiply robust estimation of the mean of the g-functional

Andrea Rotnitzky, James M. Robins|arXiv (Cornell University)|2017. 05. 24.
Statistical Methods and Inference참고 문헌 7인용 수 19
한 줄 요약

이 논문은 표본 분할을 통해 도른커 조건을 회피하면서, 위험 요소에 대해 기계학습을 활용하여 종단적 g-기능에 대한 다중로버스트(MR) 추정량을 개발한다. 이는 특정 데이터 생성 법칙 하에서 MR 추정량이 더 빠른 수렴 속도를 보일 수 있음을 보여주지만, 일반적으로는 이중로버스트(DR) 추정량과 동일한 속도로 수렴하며, 대부분의 상황에서 MR이 일관된 이점이 없음을 시사한다.

ABSTRACT

We study multiply robust (MR) estimators of the longitudinal g-computation formula of Robins (1986). In the first part of this paper we review and extend the recently proposed parametric multiply robust estimators of Tchetgen-Tchetgen (2009) and Molina, Rotnitzky, Sued and Robins (2017). In the second part of the paper we derive multiply and doubly robust estimators that use non-parametric machine-learning (ML) estimators of nuisance functions in lieu of parametric models. We use sample splitting to avoid the need for Donsker conditions, thereby allowing an analyst to select the ML algorithms of their choosing. We contrast the asymptotic behavior of our non-parametric doubly robust and multiply robust estimators. In particular, we derive formulas for their asymptotic bias. Examining these formulas we conclude that although, under certain data generating laws, the rate at which the bias of the MR estimator converges to zero can exceed that of the DR estimator, nonetheless, under most laws, the bias of the DR and MR estimators converge to zero at the same rate.

연구 동기 및 목표

  • 위험 함수에 대해 기계학습을 활용하여, 비모수적 설정으로까지 파arametric 다중로버스트 추정량을 확장하는 것.
  • 표본 분할을 통해 도른커 조건을 회피함으로써 최소한의 모델링 가정 하에서 g-기능에 대한 점근적으로 타당한 추정량을 개발하는 것.
  • 기계학습 알고리즘을 사용할 때, 다중로버스트(MR)와 이중로버스트(DR) 추정량의 점근적 편향 속도를 비교하는 것.
  • 특정 데이터 생성 메커니즘 하에서 다중로버스트 추정량이 이중로버스트 추정량보다 더 빠른 수렴 속도를 달성할 수 있는지 조사하는 것.

제안 방법

  • 표본 분할을 사용하여 교차피팅 추정량을 구성함으로써, 기계학습 알고리즘에 도른커 유형 조건이 필요 없도록 보장하는 것.
  • 일반적인 기계학습 알고리즘 하에서 이중로버스트(DR) 및 다중로버스트(MR) 추정량의 점근적 편향 공식을 유도하는 것.
  • g-기능의 역확률가중치 및 반복된 회귀 표현을 활용하여 MR 추정량을 구성하는 것.
  • 다른 모델링 가정에 기반하여 두 가지 유형의 MR 추정량, 즉 K+1-다중로버스트 및 2^K-다중로버스트를 도입하는 것.
  • 기계학습 추정치의 잔차를 포함하는 항으로 분해함으로써 DR 및 MR 추정량의 드리프트를 분석하는 것.
  • 점근 전개에서 특정 편향 성분의 지배성을 평가함으로써 DR 및 MR 추정량의 수렴 속도를 비교하는 것.

실험 결과

연구 질문

  • RQ1어떤 데이터 생성 법칙 하에서 다중로버스트 추정량이 이중로버스트 추정량보다 진짜 매개변수로 더 빠르게 수렴할 수 있는가?
  • RQ2표본 분할을 사용할 때, 위험 함수에 대해 기계학습을 활용함으로써 g-기능 추정량의 점근적 편향에 어떤 영향을 미치는가?
  • RQ3다양한 편향 성분(예: ρ_k^MR 대 χ_j,k^DR)이 MR 및 DR 추정량의 총 드리프트에 기여하는 상대적 기여도는 어떻게 되는가?
  • RQ42^K-다중로버스트 추정량에서 모델 조합의 수가 증가함에 따라, DR 추정량보다 더 빠른 수렴 가능성이 높아지는가?
  • RQ5일반적인 기계학습 알고리즘 하에서 MR 추정량의 점근적 편향이 DR 추정량과 동일한 속도로 0으로 수렴할 수 있는가 보장되는가?

주요 결과

  • 대부분의 데이터 생성 법칙 하에서 다중로버스트 추정량의 점근적 편향은 이중로버스트 추정량과 동일한 속도로 0으로 수렴한다.
  • 특정 데이터 법칙 하에서 이중로버스트 추정량의 드리프트를 지배하는 특정 교차항(χ_j,k^DR)이 우세할 경우, 다중로버스트 추정량은 더 빠르게 수렴할 수 있다.
  • ρ_k^MR 및 ρ_k^DR의 편향 성분의 수렴 속도는 일반적으로 가장 느리게 수렴하는 잔차 항에 의해 결정되며, 이는 종종 최종 시간점과 관련된다.
  • DR 추정량의 드리프트에 영향을 주는 잠재적 지배 항의 수는 K에 대해 제곱적으로 증가하므로, K가 크다면 χ_j,k^DR가 ρ^DR를 지배할 가능성이 있다.
  • 비선형 기계학습 알고리즘의 경우, R_MR,k가 R_DR,k보다 더 빨리 수렴할 것이라는 보장이 없으며, 이는 MR 추정량의 잠재적 이점을 제한한다.
  • 표본 분할은 도른커 조건이 필요 없도록 점근 이론의 타당성을 보장하며, 어떤 기계학습 알고리즘이라도 자유롭게 사용할 수 있도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.