Skip to main content
QUICK REVIEW

[논문 리뷰] Beta Shapley: a Unified and Noise-reduced Data Valuation Framework for Machine Learning

Yongchan Kwon, James Zou|arXiv (Cornell University)|2021. 10. 26.
Machine Learning and Data Classification참고 문헌 36인용 수 21
한 줄 요약

이 논문은 효율성 공리의 조건을 완화함으로써 Data Shapley를 일반화하는 통합적이고 노이즈가 감소된 데이터 평가 프레임워크인 Beta Shapley를 제안한다. 보상 함수를 베타 분포에 기반해 가중치를 적용함으로써, 특히 작은 집합의 크기에서 가중치를 더 부여함으로써 노이즈를 감소시키고, 잘못된 레이블 데이터 탐지, 서브샘플링, 포인트 추가/제거 작업에서 Data Shapley 및 최신 기법들을 능가하는 성능을 달성한다. 다양한 벤치마크에서 검증된 결과, 이는 여러 성능 지표에서 뛰어난 성능을 보인다.

ABSTRACT

Data Shapley has recently been proposed as a principled framework to quantify the contribution of individual datum in machine learning. It can effectively identify helpful or harmful data points for a learning algorithm. In this paper, we propose Beta Shapley, which is a substantial generalization of Data Shapley. Beta Shapley arises naturally by relaxing the efficiency axiom of the Shapley value, which is not critical for machine learning settings. Beta Shapley unifies several popular data valuation methods and includes data Shapley as a special case. Moreover, we prove that Beta Shapley has several desirable statistical properties and propose efficient algorithms to estimate it. We demonstrate that Beta Shapley outperforms state-of-the-art data valuation methods on several downstream ML tasks such as: 1) detecting mislabeled training data; 2) learning with subsamples; and 3) identifying points whose addition or removal have the largest positive or negative impact on the model.

연구 동기 및 목표

  • Data Shapley의 한계, 특히 모든 크기의 집합에 대해 균일하게 평균을 내는 데 기인한 높은 분산 문제를 해결하기 위해.
  • LOO 및 Data Shapley와 같은 다양한 데이터 평가 방법을 하나의 원칙적인 접근 방식으로 일반화하는 통합 프레임워크를 개발하기 위해.
  • 실제 기계학습 작업, 예를 들어 노이즈가 있는 레이블 탐지 및 주도적 데이터 선택에서 통계적 안정성과 성능을 향상시키기 위해.
  • 작은 크기의 집합에서의 마진 기여가 더 높은 신호 대 잡음 비율을 가지며, 이는 비균일한 가중치 부여 방식을 정당화하는 데 기여한다.
  • 대규모 환경에서 Beta Shapley 값의 스케일러블한 추정을 위한 효율적인 몬테카를로 기반 알고리즘을 제공하기 위해.

제안 방법

  • Beta Shapley는 효율성 공리를 완화함으로써 Data Shapley를 일반화하며, 마진 기여에 대한 민감한 가중치 부여 방식을 허용한다.
  • 모든 하위집합의 크기에서 마진 기여에 대해 베타 분포를 사용하여 가중치를 할당하며, α와 β 매개수는 작은 또는 큰 크기의 집합에 대한 강조를 조절한다.
  • 이 프레임워크는 반치수값(semivalue)으로 유도되며, 공정성과 대칭성은 유지하면서 효율성 조건을 기각한다.
  • 서브집합의 크기가 다른 경우에 비례하여 베타 가중치에 따라 샘플링하는 효율적인 몬테카를로 샘플링 알고리즘을 제안한다.
  • 양수 및 음수 데이터 값 모두를 지원하여 해로운 또는 노이즈가 있는 데이터 포인트를 식별할 수 있다.
  • 이론적 분석을 통해 Beta Shapley는 특히 작은 크기의 기여를 우선시할 경우 Data Shapley보다 통계적 노이즈가 감소함을 보여준다.

실험 결과

연구 질문

  • RQ1Shapley 값의 효율성 공리를 완화하는 것이 기계학습 분야에서 더 견고하고 효과적인 데이터 평가 프레임워크로 이어질 수 있는가?
  • RQ2작은 크기의 집합에서의 마진 기여가 큰 크기의 집합에서의 기여보다 더 높은 신호 대 잡음 비율을 가지는가?
  • RQ3베타 분포로 가중된 마진 기여를 기반으로 하는 통합 프레임워크가 실세계 기계학습 작업에서 Data Shapley 및 LOO와 같은 기존 기법들을 능가할 수 있는가?
  • RQ4데이터 평가에서 마진 기여에 대한 최적의 가중치 부여 방식은 무엇이며, 이는 기계학습 작업이나 데이터 분포에 따라 어떻게 달라지는가?
  • RQ5정확도를 유지하면서 대규모 환경에서 몬테카를로 샘플링을 통해 Beta Shapley를 효율적으로 추정할 수 있는가?

주요 결과

  • 작은 크기의 기여를 강조하는 Beta(16,1)는 15개 데이터셋 평균에서 0.757의 정확도 향상을 기록하며, 잘못된 레이블 탐지 및 포인트 추가 실험에서 최고의 성능을 보였다.
  • Beta(16,1)는 포인트 추가 작업에서 Data Shapley(Beta(1,1)) 및 LOO를 능가했으며, 고가치 데이터 포인트를 선택할 때 모델 정확도 향상이 더 빠르고 일관성 있게 이루어졌다.
  • 포인트 제거 작업에서는 Data Shapley가 약간 더 뛰어난 성능을 보였는데, 이는 균일한 가중치가 큰 크기의 집합에서의 제거 영향을 더 효과적으로 반영하기 때문이다.
  • 독일 데이터셋에서 F1 스코어는 0.872 ± 0.004를 기록했으며, LOO 및 기타 기준 기법들을 능가했다.
  • Beta(4,1) 및 Beta(16,1)를 사용한 Beta Shapley는 서브샘플링 작업에서 최고의 성능을 보였으며, Vehicle 데이터셋에서 정확도 0.772 ± 0.004를 기록했고, 균일한 샘플링 방식보다 뚜렷하게 뛰어났다.
  • 그림 7의 히트맵은 Beta(16,1)가 검 detec 및 서브샘플링 작업에서 15개 데이터셋 중 12개에서 최고 성능을 기록했으며, 최고 성능 달성에 대한 선형 스케일링 빈도가 0.757임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.