[논문 리뷰] CS-Shapley: Class-wise Shapley Values for Data Valuation in Classification
CS-Shapley는 데이터 포인트가 자신의 클래스(내클래스)에 기여하는 바와 다른 클래스(외클래스)에 기여하는 바를 구분하는 새로운 클래스별 샤플리 값 방법을 제안한다. 이는 노이즈가 있거나 잘못 레이블링된 인스턴스 탐지에 향상된 성능을 보이는 값 함수를 사용한다. 이는 두 가지 바람직한 공리에 대해 이론적으로 유일하며, 네 개의 분류기와 아홉 개의 데이터셋에서 기존 방법보다 고가치 데이터 제거 및 노이즈 레이블 탐지에서 뛰어난 성능을 보이며, 신경망을 포함한 다양한 모델 간에 값이 이식 가능하다.
Data valuation, or the valuation of individual datum contributions, has seen growing interest in machine learning due to its demonstrable efficacy for tasks such as noisy label detection. In particular, due to the desirable axiomatic properties, several Shapley value approximation methods have been proposed. In these methods, the value function is typically defined as the predictive accuracy over the entire development set. However, this limits the ability to differentiate between training instances that are helpful or harmful to their own classes. Intuitively, instances that harm their own classes may be noisy or mislabeled and should receive a lower valuation than helpful instances. In this work, we propose CS-Shapley, a Shapley value with a new value function that discriminates between training instances' in-class and out-of-class contributions. Our theoretical analysis shows the proposed value function is (essentially) the unique function that satisfies two desirable properties for evaluating data values in classification. Further, our experiments on two benchmark evaluation tasks (data removal and noisy label detection) and four classifiers demonstrate the effectiveness of CS-Shapley over existing methods. Lastly, we evaluate the "transferability" of data values estimated from one classifier to others, and our results suggest Shapley-based data valuation is transferable for application across different models.
연구 동기 및 목표
- 기존 샤플리 기반 데이터 평가 방법이 전체 정확도를 유일한 값 함수로 사용하여, 한 클래스 내에서 유용한 인스턴스와 해로운 인스턴스를 구분하지 못하는 한계를 해결하기 위해.
- 데이터 포인트가 자신의 클래스에 기여하는 바와 다른 클래스에 기여하는 바를 명시적으로 측정하는 새로운 값 함수를 제안하여, 노이즈가 있거나 잘못 레이블링된 데이터의 탐지에 더 나은 성능을 제공하기 위해.
- 제안된 클래스별 값 함수가 분류에서 데이터 평가에 대해 두 가지 바람직한 공리를 만족하는 유일한 함수임을 이론적으로 증명하기 위해.
- 다양한 데이터셋과 분류기에서 고가치 데이터 제거 및 노이즈 레이블 탐지 작업에 대해 CS-Shapley를 실증적으로 평가하기 위해.
- 간단한 모델(예: 로지스틱 회귀)에서 계산된 샤플리 기반 데이터 값이 더 복잡한 모델, 특히 딥 네트워크로의 이식 가능성에 대해 조사하기 위해.
제안 방법
- 데이터 포인트 $ i $ 가 부분집합 $ S $ 에 추가되었을 때의 내클래스 정확도 변화를 계산하는 클래스별 값 함수 $ v_y(S \cup \{i\}) $ 를 도입하며, 이는 외클래스 정확도로 가중치를 부여한다.
- 값 함수를 정의함으로써, 데이터 포인트가 내클래스 성능을 향상시키고 외클래스 성능을 감소시키면 기여도가 높아지도록 한다.
- 이 값 함수를 샤플리 값 프레임워크에 통합하여, 내클래스 유용성과 외클래스 해로움을 반영한 데이터 값 계산을 수행한다.
- 대규모 데이터셋에서 효율적으로 샤플리 값을 추정하기 위해 TMC-Shapley 근사 방법을 적용한다.
- 소스 분류기(예: 로지스틱 회귀)에서 데이터 값을 계산하고, 재학습 없이 타겟 분류기(예: MLP)에 적용하여 이식 가능성 평가를 수행한다.
- 고가치 데이터 제거 작업과 노이즈 레이블 탐지 작업을 통해 다양한 분류기와 데이터셋에서 성능을 벤치마킹한다.
실험 결과
연구 질문
- RQ1분류에서 데이터 평가를 위한 값 함수 중 내클래스 기여와 외클래스 기여를 구분할 수 있어 유해하거나 노이즈가 있는 인스턴스를 더 잘 탐지할 수 있는 것이 존재하는가?
- RQ2제안된 클래스별 값 함수는 분류에서 데이터 평가에 대해 두 가지 바람직한 공리적 성질을 만족하는 유일한 함수인가?
- RQ3CS-Shapley는 고가치 데이터 제거 및 노이즈 레이블 탐지 작업에서 기존 샤플리 기반 데이터 평가 방법보다 뛰어난 성능을 보이는가?
- RQ4간단한 분류기(예: 로지스틱 회귀)에서 계산된 샤플리 기반 데이터 값은 더 복잡한 모델, 예를 들어 딥 네트워크로 효과적으로 이식 가능한가?
- RQ5소스 분류기에서 데이터 값의 성능이 타겟 분류기에서의 성능을 신뢰성 있게 예측할 수 있는가?
주요 결과
- CS-Shapley는 모든 아홉 개의 데이터셋과 네 개의 분류기에서 고가치 데이터 제거 작업에서 기존 방법을 능가하며, 아홉 개 데이터셋 중 여덟 개에서 통계적으로 유의미한 향상이 이루어졌다.
- 노이즈 레이블 탐지 작업에서 뛰어난 성능을 보였으며, 기준 방법보다 잘못 레이블링된 인스턴스를 더 정확하게 식별했다.
- 이론적 분석을 통해 제안된 값 함수가 내클래스 기여의 공정성과 외클래스 해로움에 대한 민감성이라는 두 가지 바람직한 공리를 만족하는 유일한 함수임을 확인했다.
- 로지스틱 회귀에서 계산된 샤플리 기반 데이터 값은 MLP로 이식 가능하며, 타겟 모델에서의 성능 패턴이 소스 모델과 밀접하게 일치했다.
- 데이터 값의 이식 가능성은 샤플리 값이 다양한 모델 아키텍처에 대해 강건한 일반적인 데이터 품질 신호를 포착하고 있음을 시사한다.
- CS-Shapley는 신경망으로 이식된 후에도 강력한 성능을 유지하여, 실무에서 확장 가능하고 모델 독립적인 데이터 평가에 잠재력을 지닌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.