Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient computation and analysis of distributional Shapley values

Yongchan Kwon, Manuel A. Rivas|arXiv (Cornell University)|2020. 07. 02.
Bayesian Modeling and Causal Inference참고 문헌 34인용 수 15
한 줄 요약

이 논문은 선형 회귀, 이진 분류, 비모수 밀도 추정에서 분포 기반 셰플리 값(DShapley)에 대한 최초의 해석적 표현을 제안하며, 이전 방법보다 수 개의 지수 차수 빠른 계산을 가능하게 한다. 제안된 프레임워크는 마할라노비스 거리와 오차 분산과 같은 데이터 특성에 따라 DShapley가 어떻게 달라지는지를 드러내는 해석 가능한 공식을 제공한다.

ABSTRACT

Distributional data Shapley value (DShapley) has recently been proposed as a principled framework to quantify the contribution of individual datum in machine learning. DShapley develops the foundational game theory concept of Shapley values into a statistical framework and can be applied to identify data points that are useful (or harmful) to a learning algorithm. Estimating DShapley is computationally expensive, however, and this can be a major challenge to using it in practice. Moreover, there has been little mathematical analyses of how this value depends on data characteristics. In this paper, we derive the first analytic expressions for DShapley for the canonical problems of linear regression, binary classification, and non-parametric density estimation. These analytic forms provide new algorithms to estimate DShapley that are several orders of magnitude faster than previous state-of-the-art methods. Furthermore, our formulas are directly interpretable and provide quantitative insights into how the value varies for different types of data. We demonstrate the practical efficacy of our approach on multiple real and synthetic datasets.

연구 동기 및 목표

  • 기존 DShapley 추정 방법에서 높은 계산 비용과 이론적 분석 부족 문제를 해결한다.
  • 선형 회귀, 이진 분류, 밀도 추정과 같은 표준 기계학습 문제에서 DShapley에 대한 최초의 폐쇄형 해석적 표현을 개발한다.
  • 수학적으로 탄탄한 폐쇄형 해를 유도하여 빠르고 안정적이며 해석 가능한 데이터 평가를 가능하게 한다.
  • 기존의 몬테카를로 기반 방법보다 훨씬 빠르면서도 정확도를 유지하는 실용적인 알고리즘을 제공한다.
  • 입력 크기와 노이즈 수준과 같은 데이터 특성에 따라 DShapley가 어떻게 변하는지에 대한 정량적 통찰을 제공한다.

제안 방법

  • 독립 동일분포(i.i.d.) 샘플링 하에서 전체 기대의 법칙과 조건부 모멘트를 사용하여 DShapley의 해석적 표현을 유도한다.
  • 선형 회귀의 경우, 마할라노비스 거리 $x^{*T}\Sigma_X^{-1}x^*$와 오차 분산 $e^{*2}$에 대한 함수로 DShapley를 표현하며, 조건부 기대와 분산 분해를 활용한다.
  • 이진 분류의 경우, 로지스틱 손실과 데이터 분포 하에서의 조건부 기대를 사용하여 DShapley를 유도한다.
  • 비모수 밀도 추정의 경우, 커널 밀도 추정을 사용하고, 변동에 따른 기대 로그우도 차이를 통해 DShapley를 유도한다.
  • 해석적 형태를 기반으로 한 새로운 추정 알고리즘을 제안하여 몬테카를로 샘플링을 피하고 계산 복잡도를 감소시킨다.
  • 집중 불등식과 교차검증을 활용해 밴드위드 선택을 위한 DShapley의 상한 및 하한을 제안하여 효율적인 근사화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1선형 회귀, 이진 분류, 비모수 밀도 추정에서 DShapley의 해석적 표현은 무엇인가?
  • RQ2DShapley는 마할라노비스 거리와 노이즈 분산과 같은 데이터 특성에 따라 어떻게 변하는가?
  • RQ3폐쇄형 DShapley 표현식은 기존 몬테카를로 기반 방법보다 현저히 더 빠르고 안정적인 추정을 가능하게 하는가?
  • RQ4유도된 공식은 개별 데이터 포인트의 기여도에 대해 어떻게 해석 가능한 통찰을 제공하는가?
  • RQ5제안된 알고리즘의 실증 성능은 실제 및 시뮬레이션 데이터 세트에서 계산 속도와 정확도 측면에서 어떻게 나타나는가?

주요 결과

  • 제안된 선형 회귀, 이진 분류, 밀도 추정에 대한 해석적 DShapley 공식은 이전 최고 수준의 몬테카를로 방법보다 수 개의 지수 차수 빠르게 계산할 수 있다.
  • 오차 분산 $e^{*2}$가 증가함에 따라 DShapley는 감소하며, $e^{*2}$가 클 경우 마할라노비스 거리 $x^{*T}\Sigma_X^{-1}x^{*}$에 대한 DShapley의 의존성은 비단조화적이다.
  • 낮은 오차 분산 조건에서는 $x^{*T}\Sigma_X^{-1}x^{*}$가 증가할수록 DShapley가 증가하므로, 더 극단적인 입력이 더 높은 기여도를 가짐을 시사한다.
  • 데이터셋 크기 $m$이 증가함에 따라 DShapley의 절대 크기는 감소하며, 이는 경계 기여도의 감소를 반영한다.
  • DShapley의 하한 근사가 실용적으로 잘 작동하는 반면, 상한은 낮은 유용성을 보이며, 추정에 상한을 사용할 경우 주의가 필요하다는 것을 시사한다.
  • 실제 및 시뮬레이션 데이터 세트에서의 수치 실험 결과, 제안된 알고리즘은 계산 시간을 극적으로 줄이면서도 높은 정확도를 유지하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.