Skip to main content
QUICK REVIEW

[논문 리뷰] DU-Shapley: A Shapley Value Proxy for Efficient Dataset Valuation

Felipe Garrido-Lucero, Benjamin Heymann|arXiv (Cornell University)|2023. 06. 03.
Explainable Artificial Intelligence (XAI)참고 문헌 42인용 수 4
한 줄 요약

이 논문은 데이터셋 평가에서 셰플리 값의 새로운 효율적 대체 측정법인 DU-Shapley를 소개한다. 이 방법은 데이터셋 크기에 따라 변하는 유틸리티 함수의 구조를 활용하여, 협력 규모에 대한 이산 균등 분포 위에서 기대값으로 셰플리 값을 근사함으로써 계산 복잡도를 감소시킨다. 데이터 소유자 수가 증가함에 따라 진짜 셰플리 값으로 거의 확실히 수렴하며, 소수의 데이터 소유자 조건에서도 기존 몬테카를로 방법보다 뛰어난 성능을 보인다.

ABSTRACT

We consider the dataset valuation problem, that is, the problem of quantifying the incremental gain, to some relevant pre-defined utility of a machine learning task, of aggregating an individual dataset to others. The Shapley value is a natural tool to perform dataset valuation due to its formal axiomatic justification, which can be combined with Monte Carlo integration to overcome the computational tractability challenges. Such generic approximation methods, however, remain expensive in some cases. In this paper, we exploit the knowledge about the structure of the dataset valuation problem to devise more efficient Shapley value estimators. We propose a novel approximation, referred to as discrete uniform Shapley, which is expressed as an expectation under a discrete uniform distribution with support of reasonable size. We justify the relevancy of the proposed framework via asymptotic and non-asymptotic theoretical guarantees and illustrate its benefits via an extensive set of numerical experiments.

연구 동기 및 목표

  • 데이터셋 평가에서 정확한 셰플리 값 추정과 몬테카를로 기반 추정의 높은 계산 비용을 해결하기 위해.
  • 유틸리티 함수가 데이터셋 크기에 따라 구조적으로 의존하는 특성을 활용하여 일반 몬테카를로 근사보다 더 효율적인 대안을 개발하기 위해.
  • 제안된 방법의 근사 오차에 대한 이론적 보장을 제공하기 위해(점점 커지는 경우와 그렇지 않은 경우 모두).
  • 경험적으로 DU-Shapley가 소수의 데이터 소유자 조건에서도 기존의 셰플리 값 근사법(예: 오웬-셰플리)을 능가함을 보여주기 위해.

제안 방법

  • DU-Shapley는 협력 규모에 대한 이산 균등 분포 위에서 기대값으로 셰플리 값을 근사한다. 이 분포의 지지 집합 크기는 데이터 소유자의 수와 같다.
  • 모든 부분집합을 전수 조사하는 대신, 고정된 협력 규모에 따라 마진 기여도를 평균화하는 구조적 근사법을 도입한다.
  • 데이터셋 평가에서 유틸리티 함수가 일반적으로 총 데이터 포인트 수에 의존하므로, 기대 데이터셋 크기에 기반한 단순화가 가능하다는 점을 활용한다.
  • 추정식은 $ \psi_i = \frac{1}{I} \left[ w(n_i) + w(n_\mathcal{I}) - w(n_{\mathcal{I}\setminus\{i\}}) \right] + \frac{1}{I} \sum_{k=1}^{I-2} \frac{1}{\binom{I-1}{k}} \sum_{\substack{\mathcal{S} \subseteq \mathcal{I}\setminus\{i\} \\ |\mathcal{S}|=k}} \left[ w(n_\mathcal{S} + n_i) - w(n_\mathcal{S}) \right] $ 로 정의되며, 기대값을 사용한 간소화된 형태도 포함된다.
  • 이 방법은 중간 크기의 협력 집합에 대한 합을 평균 데이터셋 크기 하에서의 기대 유틸리티로 근사하는 방식으로 개선된 변형인 DU-Shapley++를 포함한다.
  • 이론적 분석을 통해 데이터 소유자 수가 증가함에 따라 DU-Shapley가 진짜 셰플리 값으로 거의 확실히 수렴한다는 것을 입증하였다.
Figure 2: Monte Carlo’s expected error for limited sampling budget ( $T=I$ ) versus DU-Shapley ’s expected bias for a value function $w(n)=1-\frac{10^{k(\mathcal{I})}}{10^{k(\mathcal{I})}+n}$ where $k(\mathcal{I})=\lfloor\log(n_{\mathcal{I}})\rfloor-1$ . For each value of $I$ , we drew $100$ times t
Figure 2: Monte Carlo’s expected error for limited sampling budget ( $T=I$ ) versus DU-Shapley ’s expected bias for a value function $w(n)=1-\frac{10^{k(\mathcal{I})}}{10^{k(\mathcal{I})}+n}$ where $k(\mathcal{I})=\lfloor\log(n_{\mathcal{I}})\rfloor-1$ . For each value of $I$ , we drew $100$ times t

실험 결과

연구 질문

  • RQ1유틸리티 함수의 구조를 활용하여 데이터셋 평가에 적합한 더 효율적인 셰플리 값 근사법을 설계할 수 있는가?
  • RQ2데이터 소유자 수가 증가함에 따라 제안된 DU-Shapley 추정치가 진짜 셰플리 값으로 수렴하는가?
  • RQ3DU-Shapley의 근사 오차는 평균 데이터셋 크기, 유틸리티 함수의 성장률 등의 주요 문제 파라미터에 따라 어떻게 변화하는가?
  • RQ4소수의 데이터 소유자 조건에서도 DU-Shapley가 일반 몬테카를로 방법과 오웬-셰플리와 같은 최첨단 근사법을 실제로 능가할 수 있는가?

주요 결과

  • DU-Shapley는 데이터 소유자 수에 대해 지수적으로 증가하는 정확한 셰플리 값 계산에 비해 필요한 유틸리티 평가 횟수를 크게 줄였다.
  • 평균 데이터셋 크기, 그 분산, 유틸리티 함수의 성장률에 명시적으로 의존하는 비점근적 오차 경계를 통해 이론적으로 타당성이 입증되었다.
  • 데이터 소유자 수가 증가함에 따라 DU-Shapley는 진짜 셰플리 값으로 거의 확실히 수렴한다. 이는 제한된 샘플링 예산 조건에서 일반 몬테카를로 방법이 달성하지 못하는 성질이다.
  • 경험적 평가 결과, 소수의 데이터 소유자 조건에서도 DU-Shapley가 여러 데이터셋 평가 벤치마크에서 오웬-셰플리를 포함한 다른 셰플리 값 근사법보다 뛰어난 성능을 보였다.
  • DU-Shapley++는 계산 비용은 DU-Shapley와 동일하지만, 부분합을 협력 규모에 대한 기대값으로 대체함으로써 근사 정확도를 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.