Skip to main content
QUICK REVIEW

[논문 리뷰] Floodgate: inference for model-free variable importance

Lu Zhang, Lucas Janson|arXiv (Cornell University)|2020. 07. 02.
Statistical Methods and Inference참고 문헌 74인용 수 13
한 줄 요약

Floodgate는 조정 변수 Z에 따라 결과 Y와 공변량 X 간의 조건부 의존도를 측정하는 변수 중요도에 대한 모델 자유 추론 방법이다. 이 방법은 최소 평균 제곱 오차(mMSE) 갭에 대해 渐近적으로 타당한 신뢰구간을 생성하며, 이는 모수적 가정 없이도 강력하고 해석 가능한 추론을 가능하게 한다. 사용자가 지정한 임의의 회귀 함수(예: 머신러닝 모델)를 활용하며, 그 추정 오차에 따라 정확도가 자동으로 조정되어, 비모수적 가정 없이도 유연하고 정확한 분석이 가능하다.

ABSTRACT

Many modern applications seek to understand the relationship between an outcome variable $Y$ and a covariate $X$ in the presence of a (possibly high-dimensional) confounding variable $Z$. Although much attention has been paid to testing \emph{whether} $Y$ depends on $X$ given $Z$, in this paper we seek to go beyond testing by inferring the \emph{strength} of that dependence. We first define our estimand, the minimum mean squared error (mMSE) gap, which quantifies the conditional relationship between $Y$ and $X$ in a way that is deterministic, model-free, interpretable, and sensitive to nonlinearities and interactions. We then propose a new inferential approach called \emph{floodgate} that can leverage any working regression function chosen by the user (allowing, e.g., it to be fitted by a state-of-the-art machine learning algorithm or be derived from qualitative domain knowledge) to construct asymptotic confidence bounds, and we apply it to the mMSE gap. \acc{We additionally show that floodgate's accuracy (distance from confidence bound to estimand) is adaptive to the error of the working regression function.} We then show we can apply the same floodgate principle to a different measure of variable importance when $Y$ is binary. Finally, we demonstrate floodgate's performance in a series of simulations and apply it to data from the UK Biobank to infer the strengths of dependence of platelet count on various groups of genetic mutations.

연구 동기 및 목표

  • Z에 따라 Y와 X 간의 의존도 강도를 측정하는 모델 자유, 해석 가능, 민감한 변수 중요도 측정법을 개발하는 것.
  • E[Y|X,Z]에 대한 모수적 또는 매끄러움 가정 없이도 이 측정법에 대해 타당한 渐近적 신뢰구간을 제공하는 것.
  • 사용자가 선택한 작업 회귀 함수의 평균 제곱 오차에 따라 신뢰구간의 정확도가 자동으로 조정되도록 보장하는 것.
  • 이중로버스트 설정으로 확장하여 이진 결과 및 X|Z 분포가 부분적으로 알려진 설정에도 적용 가능하도록 하는 것.
  • 시뮬레이션과 UK Biobank의 혈소판 수치 유전성 분석을 통한 실제 응용을 통해 방법의 타당성과 성능을 입증하는 것.

제안 방법

  • Z가 주어졌을 때 X를 포함함으로써 예측 오차가 얼마나 감소하는지를 측정하는 모델 자유, 해석 가능한 변수 중요도 측정법으로 mMSE 갭을 정의한다.
  • 귀무가설 하에서 X|Z의 분포를 유지하는 조건부 순열 기반 방법을 사용해 mMSE 갭에 대한 渐近적 하한 신뢰구간을 구축한다.
  • 사용자가 지정한 작업 회귀 함수 μ(X,Z)를 사용해 E[Y|X,Z]를 추정함으로써 머신러닝 또는 도메인 전문 지식 기반 모델을 통합할 수 있다.
  • 관측된 예측 오차와 귀무가설 하에서 재생산된 오차 간의 차이를 기반으로 한 검정 통계량을 사용하며, 귀무가설 하에서 조건부 표본 추출을 통해 校정한다.
  • E[Y|X,Z]에 대해 매끄러움, 희박성, 모수적 형태에 대한 가정이 전혀 필요 없으며, 이중로버스트 설정으로도 확장 가능하도록 보장한다.
  • 데이터 분할 전략을 적용해 정확도를 향상시키고, 작업 모델이 잘못 지정된 경우에도 신뢰구간의 변동성과 타당성을 유지한다.

실험 결과

연구 질문

  • RQ1Z에 따라 Y와 X 간의 비선형성 및 상호작용 효과를 캡처할 수 있는 모델 자유, 해석 가능, 민감한 변수 중요도 측정법을 정의할 수 있는가?
  • RQ2E[Y|X,Z]에 대해 모수적 또는 매끄러운 형태를 가정하지 않고도 이 측정법에 대해 渐近적으로 타당한 신뢰구간을 어떻게 구성할 수 있는가?
  • RQ3신뢰구간의 정확도가 사용자가 제공한 회귀 함수의 품질에 얼마나 잘 적응하는가?
  • RQ4이 프레임워크를 이진 결과 및 X|Z 분포가 부분적으로 알려진 설정(예: 다변량 정규분포, 이산 마르코프 체인)으로 확장할 수 있는가?
  • RQ5유고차원 조정 변수가 존재하는 유전적 연관성 연구와 같은 실제 응용에서 이 방법은 유한 표본에서 어떻게 성능을 발휘하는가?

주요 결과

  • Floodgate는 E[Y|X,Z]가 임의이거나 비매끄러운 경우에도 mMSE 갭에 대해 渐近적으로 타당한 신뢰구간을 생성한다.
  • 신뢰구간의 폭은 사용자가 지정한 작업 회귀 함수의 평균 제곱 오차에 따라 자동으로 조정되어, 모델이 더 정확할수록 더 좁은 구간을 제공한다.
  • 데이터 분할과 귀무가설 하에서의 조건부 순열을 통해 작업 모델이 잘못 지정된 경우에도 타당성이 유지된다.
  • UK Biobank 응용 분석에서 Floodgate는 SNP 그룹 간 혈소판 수치의 상당한 유전성 요인을 식별했으며, 하한 신뢰구간이 이전에 발견되지 않은 유전적 영향을 드러냈다.
  • 상호작용의 구조를 사전에 알 필요 없이도 복잡한 비선형 유전적 영향을 포착하는 데서 전통적인 모수적 접근보다 뛰어난 성능을 보였다.
  • 이진 결과 및 부분적으로 알려진 X|Z 분포(예: 다변량 정규분포, 이산 마르코프 체인)로의 확장은 프레임워크의 유연성과 광범위한 적용 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.