Skip to main content
QUICK REVIEW

[논문 리뷰] Shapley value confidence intervals for variable selection in regression models

Daniel Fryer, Inga Strümke|arXiv (Cornell University)|2020. 01. 27.
Advanced Statistical Methods and Models인용 수 7
한 줄 요약

이 논문은 게임 이론을 통해 결정계수의 분해를 활용하여 회귀 모델에서 변수 중요도를 평가하기 위해 서브셰일리 값에 대한 渐近적 신뢰구간을 제안한다. 타원대칭 조건 하에서 서브셰일리 값의 渐近적 정규성을 입증함으로써, 부트스트랩 방법보다 계산 효율성과 정확도에서 뛰어난 효율적인 가설 검정 및 구간 추정이 가능하다.

ABSTRACT

Multiple linear regression is a commonly used inferential and predictive process, whereby a single response variable is modeled via an affine combination of multiple explanatory covariates. The coefficient of determination is often used to measure the explanatory power of the chosen combination of covariates. A ranking of the explanatory contribution of each of the individual covariates is often sought in order to draw inference regarding the importance of each covariate with respect to the response phenomenon. A recent method for ascertaining such a ranking is via the game theoretic Shapley value decomposition of the coefficient of determination. Such a decomposition has the desirable efficiency, monotonicity, and equal treatment properties. Under an elliptical assumption, we obtain the asymptotic normality of the Shapley values. We then utilize this result in order to construct confidence intervals and hypothesis tests regarding such quantities. Monte Carlo studies regarding our results are provided. We found that our asymptotic confidence intervals are computationally superior to competing bootstrap methods and are able to improve upon the performance of such intervals. Analyses of housing and real estate data are used to demonstrate the applicability of our methodology.

연구 동기 및 목표

  • 순수한 순위 매기기 초과하여 변수 중요도에 대한 통계적 추론이 필요함을 해결하기 위해.
  • 서브셰일리 값에 대한 부트스트랩 기반 신뢰구간의 계산 효율성 떨어지는 대안을 제공하기 위해.
  • 타원분포 가정 하에서 서브셰일리 값의 渐近적 정규성을 입증하여 타당한 추론을 가능하게 하기 위해.
  • R²에 대한 개별 변수 기여도에 대한 가설 검정 및 신뢰구간 구축을 가능하게 하기 위해.
  • 실세계 주택 및 부동산 데이터 응용을 통해 방법의 실용적 유용성을 입증하기 위해.

제안 방법

  • 논문은 결정계수(R²)의 게임이론적 서브셰일리 값 분해를 사용하여 각 공변량에 대해 공정하고 효율적이며 단조적인 기여도를 할당한다.
  • 공변량의 타원대칭 조건 하에서 서브셰일리 값의 渐近적 분포를 도출한다.
  • 서브셰일리 값의 渐近적 정규성이 입증되어 신뢰구간 및 가설 검정의 구축이 가능해진다.
  • 서브셰일리 값의 渐近적 분포를 위한 델타 방법 및 분산-공분산 추정을 정규성 조건 하에서 활용한다.
  • 유한표본 성능을 검증하기 위해 몬테카를로 시뮬레이션을 실시한다.
  • 신뢰구간의 커버리지 확률 및 계산 비용 측면에서 부트스트랩 기반 구간과의 실증적 비교를 수행한다.

실험 결과

연구 질문

  • RQ1타원대칭 조건 하에서 회귀 모델에서 서브셰일리 값에 대한 渐近적 신뢰구간을 구축할 수 있는가?
  • RQ2이러한 渐近적 구간은 커버리지 정확도 및 계산 효율성 측면에서 부트스트랩 기반 구간과 어떻게 비교되는가?
  • RQ3제안된 구간은 변수 중요도에 대한 가설 검정에서 적절한 I종 오류 비율을 유지하는가?
  • RQ4실세계 주택 및 부동산 데이터 응용에서 이 방법의 실증적 성능은 어떠한가?
  • RQ5R²의 서브셰일리 값 분해를 통해 변수 기여도에 대한 타당한 통계적 추론을 제공할 수 있는가?

주요 결과

  • 타원대칭 조건 하에서 회귀 계수의 서브셰일리 값은 渐近적 정규성을 띠며, 이는 타당한 추론을 가능하게 한다.
  • 제안된 渐近적 신뢰구간은 부트스트랩 방법과 비교해 유사하거나 더 높은 커버리지 정확도를 달성한다.
  • 특히 고차원 설정에서 부트스트랩 기반 방법보다 서브셰일리 값의 渐近적 접근이 훨씬 빠르다.
  • 몬테카를로 연구를 통해 다양한 표본 크기 및 상관 구조에서 渐近적 구간이 적절한 커버리지 수준을 유지함을 확인하였다.
  • 실데이터 분석에서 이 방법은 주택 및 부동산 데이터셋에서 핵심 예측변수를 신뢰할 수 있는 추론과 함께 성공적으로 식별하였다.
  • 이론적 엄밀성과 계산 효율성을 결합함으로써 기존 방법에 비해 변수 중요도 평가에 있어 향상된 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.