[논문 리뷰] Towards Efficient Data Valuation Based on the Shapley Value
이 논문은 샤플리 값(Shapley value)을 이용한 데이터 가치 평가를 연구하고, 대규모 ML 데이터셋의 데이터 기여도를 추정하기 위한 효율적인 근사 알고리즘을 개발하며, 공정한 보상 및 데이터 시장 설계에 적용 가능성을 제시한다.
"How much is my data worth?" is an increasingly common question posed by organizations and individuals alike. An answer to this question could allow, for instance, fairly distributing profits among multiple data contributors and determining prospective compensation when data breaches happen. In this paper, we study the problem of data valuation by utilizing the Shapley value, a popular notion of value which originated in cooperative game theory. The Shapley value defines a unique payoff scheme that satisfies many desiderata for the notion of data value. However, the Shapley value often requires exponential time to compute. To meet this challenge, we propose a repertoire of efficient algorithms for approximating the Shapley value. We also demonstrate the value of each training instance for various benchmark datasets.
연구 동기 및 목표
- Shapley 값을 사용하여 ML 환경에서 데이터 기여의 공정한 가치 평가를 촉진한다.
- 대규모 데이터셋에서 SV 계산의 계산적 도전을 다룬다.
- 다양한 가정 하에서 증명 가능한 보장을 갖춘 확장 가능한 근사 알고리즘을 개발한다.
- 안정성, 매끄러움, 점진적 학습을 활용한 ML 작업에 대한 실용적 추정기를 탐구한다.
- 실행 가능성과 확장성을 입증하기 위해 벤치마크 데이터셋에서 경험적 검증을 제공한다.
제안 방법
- 데이터 점수화를 데이터 포인트가 플레이어이고 유틸리티가 데이터셋 기반 모델 성능인 협력 게임으로 형식화한다.
- SV 추정을 위한 확률적 보장을 갖는 기본 순열 샘플링 방법을 개발한다.
- 유틸리티 평가를 줄이기 위해 그룹 테스트 기반의 SV 추정 알고리즘을 도입한다.
- SV 회복을 위한 데이터 값의 잠재적 희소성을 활용하기 위해 압축 센싱 아이디어(무작위 Bernoulli 측정)를 적용한다.
- 학습 알고리즘의 안정성을 활용하여 균일 가치 분배를 근사로 정당화한다.
- ML 모델의 SV 추정을 가속화하기 위해 영향 함수 기반 휴리스틱을 도입한다.
실험 결과
연구 질문
- RQ1증명 가능한 보장을 갖고 대규모 ML 데이터셋에서 데이터 가치 평가를 위한 Shapley 값을 효율적으로 근사할 수 있는가?
- RQ2경계가 있는 유틸리티, 단조성/희소 가치, 안정성, 매끄러운 손실 등의 서로 다른 가정이 SV 추정의 효율성과 정확도에 어떤 영향을 미치는가?
- RQ3일반적인 ML 작업에서 어떤 실용적 추정기(그룹 테스트, 압축 센싱, 영향 함수)가 잘 작동하는가?
- RQ4실무에서 SV 기반 데이터 가치 평가가 프라이버시 및 적대적 강건성과 어떤 관련이 있는가?
주요 결과
- 경계가 있는 유틸리티 하에서 O(N(log N)^2) 모델 평가 알고리즘이 증명 가능한 오차 보장을 가지고 SV를 근사할 수 있다.
- 유틸리티가 단조롭고 SV가 희소하면 누적 유지 관리를 통해 모델 학습 횟수를 O(log log N)으로 줄일 수 있다.
- 그룹 테스트 기반의 SV 추정은 기본 순열 샘플링에 비해 유틸리티 평가를 significantly 줄인다.
- 희소성 가정하에 압축 순열 샘플링은 O(N log N log log N) 평가로 SV를 회복할 수 있다.
- 영향 함수 기반 휴리스틱은 SV 추정을 가속화할 수 있으며, 특히 최대 부분집합 근사를 활용할 때 그렇다.
- 안정적인 학습 알고리즘은 거의 균일한 데이터 값을 산출하여 균일 가치 분배를 실용적 근사로 지지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.