Skip to main content
QUICK REVIEW

[논문 리뷰] Absolute Shapley Value

Jinfei Liu|arXiv (Cornell University)|2020. 03. 23.
Bayesian Modeling and Causal Inference참고 문헌 8인용 수 4
한 줄 요약

이 논문은 마진 기여가 음수일 경우에도 절대값을 취함으로써 기계학습에서 데이터 중요도를 평가하는 데 새로운 방법인 절대 샤플리 값(absolute Shapley Value)을 제안한다. 아이ris 데이터셋에서의 실험 결과, 절대 샤플리 값은 원본 및 제로 샤플리 값보다 진정으로 중요한 또는 중요하지 않은 데이터 튜플을 더 잘 식별하며, 샤플리 값 기반으로 상위-k 데이터로 학습했을 때 모델 정확도가 뛰어나다는 점에서 그 성능이 뛰어나다.

ABSTRACT

Shapley value is a concept in cooperative game theory for measuring the contribution of each participant, which was named in honor of Lloyd Shapley. Shapley value has been recently applied in data marketplaces for compensation allocation based on their contribution to the models. Shapley value is the only value division scheme used for compensation allocation that meets three desirable criteria: group rationality, fairness, and additivity. In cooperative game theory, the marginal contribution of each contributor to each coalition is a nonnegative value. However, in machine learning model training, the marginal contribution of each contributor (data tuple) to each coalition (a set of data tuples) can be a negative value, i.e., the accuracy of the model trained by a dataset with an additional data tuple can be lower than the accuracy of the model trained by the dataset only. In this paper, we investigate the problem of how to handle the negative marginal contribution when computing Shapley value. We explore three philosophies: 1) taking the original value (Original Shapley Value); 2) taking the larger of the original value and zero (Zero Shapley Value); and 3) taking the absolute value of the original value (Absolute Shapley Value). Experiments on Iris dataset demonstrate that the definition of Absolute Shapley Value significantly outperforms the other two definitions in terms of evaluating data importance (the contribution of each data tuple to the trained model).

연구 동기 및 목표

  • 기계학습 모델의 데이터 평가에서 음수 마진 기여 문제를 해결하기 위해.
  • 마진 기여의 절대값을 취하는 것이 데이터 중요도 평가를 향상시키는지 평가하기 위해.
  • 원본, 제로, 절대 샤플리 값 정의의 세 철학적 접근 방식을 비교하기 위해.
  • 모델 성능 측면에서 가장 잘 중요한 데이터 튜플을 식별하는 정의가 무엇인지 실증적으로 검증하기 위해.
  • 데이터 마켓플레이스 및 모델 훈련에서 이론적으로 타당하고 실용적으로 효과적인 데이터 평가 방법을 제공하기 위해.

제안 방법

  • 각 데이터 튜플의 마진 기여를 샤플리 값 계산에서 절대값으로 대체하는 새로운 정의인 절대 샤플리 값을 제안한다.
  • 랜덤 순열을 통한 마진 기여의 평균을 구함으로써 효율적으로 샤플리 값을 근사하기 위해 몬테카를로 샘플링을 사용한다.
  • 세 가지 변형을 정의한다: 원본(원래 마진 기여), 제로(0으로 클리핑), 절대(마진 기여의 절대값).
  • 보류된 테스트 세트에서 평가된 모델 정확도를 기반으로 표준 유틸리티 함수를 사용한다(SVM 및 로지스틱 회귀).
  • 아이리스 데이터셋에 대해 샤플리 값을 적용하여 상위-K 및 하위-K 데이터 튜플로 모델을 훈련하고 정확도를 측정한다.
  • 수렴 제어를 통해 알고리즘적 샘플링을 사용하여 샤플리 값을 추정함으로써 편향이 없고 효율적인 근사를 확보한다.

실험 결과

연구 질문

  • RQ1마진 기여의 절대값을 취하는 것이 기계학습 모델에서 중요한 데이터 튜플을 식별하는 데 향상되는가?
  • RQ2원본, 제로, 절대 샤플리 값 정의의 차이가 데이터 중요도 순위에 어떤 영향을 미치는가?
  • RQ3기존 정의보다 절대 샤플리 값이 진정으로 중요한 데이터 튜플과 중요하지 않은 데이터 튜플을 더 잘 구분할 수 있는가?
  • RQ4절대 샤플리 값에 의해 순위가 매겨진 상위-K 데이터 튜플로 훈련된 모델이 원본 또는 제로 샤플리 값 기반 상위-K로 훈련된 모델보다 더 높은 정확도를 달성하는가?
  • RQ5특히 마진 기여가 음수일 경우, 절대 샤플리 값 정의가 데이터 튜플의 진정한 기여도를 더 잘 포착하는가?

주요 결과

  • 아이리스 데이터셋에서 로지스틱 회귀 및 SVM 모두에 대해, 절대 샤플리 값에 의해 상위 35개 튜플로 훈련된 모델은 100.00%의 정확도를 달성하여 고가치 데이터를 잘 식별한다는 점을 확인한다.
  • 반대로, 절대 샤플리 값에 의해 하위 35개 튜플로 훈련된 모델은 60.00%의 정확도를 기록했으며, 제로 샤플리 정의가 기록한 63.33%보다 유의미하게 낮아, 절대 샤플리 값이 중요하지 않은 데이터를 더 잘 식별한다는 점을 시사한다.
  • 반면, 원본 샤플리 값은 상위-K 및 하위-K 데이터 튜플로 훈련된 모델에 대해 동일한 정확도(100.00%)를 기록하여 중요하고 중요하지 않은 데이터를 구분하지 못한다는 점을 보여주며, 이는 이 정의가 실패한다는 것을 의미한다.
  • 절대 샤플리 값 정의는 상위 10개 튜플 중 6개의 서포트 벡터를 정확히 식별했으며, 제로 정의(5개)와 원본 정의(4개)를 능가하여 모델 구조와의 일치성이 더 뛰어나다는 것을 확인한다.
  • 절대 샤플리 값 기반 하위 10개 튜플은 특징 공간에서 더 조밀하고 중심에 집중된 경향을 보였으며, 이는 영향력이 낮다는 점과 일치한다. 이는 낮은 평가와도 부합한다.
  • 결과적으로 절대 샤플리 값은 원본 및 제로 정의와 달리 큰 절대값을 가진 음수 기여를 중요하게 간주하므로, 데이터 중요도 평가에서 더 뛰어나다는 것이 입증된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.