[논문 리뷰] An Empirical and Comparative Analysis of Data Valuation with Scalable Algorithms
이 논문은 지도학습에서 Shapley 값의 근사 계산을 위한 확장 가능한 KNN 기반 휴리스틱을 제안하며, 모델 크기와 무관한 복잡도를 통해 효율적인 데이터 가치 평가를 달성한다. 실험 결과, 레이블 노이즈 보정, 데이터 요약, 활성 학습 등 다양한 분야에서 기존 방법과 동등하거나 이를 초월하는 성능을 보이며, 상당한 속도 향상을 제공한다.
This paper focuses on valuating training data for supervised learning tasks and studies the Shapley value, a data value notion originated in cooperative game theory. The Shapley value defines a unique value distribution scheme that satisfies a set of appealing properties desired by a data value notion. However, the Shapley value requires exponential complexity to calculate exactly. Existing approximation algorithms, although achieving great improvement over the exact algorithm, relies on retraining models for multiple times, thus remaining limited when applied to larger-scale learning tasks and real-world datasets. In this work, we develop a simple and efficient heuristic for data valuation based on the Shapley value with complexity independent with the model size. The key idea is to approximate the model via a $K$-nearest neighbor ($K$NN) classifier, which has a locality structure that can lead to efficient Shapley value calculation. We evaluate the utility of the values produced by the $K$NN proxies in various settings, including label noise correction, watermark detection, data summarization, active data acquisition, and domain adaption. Extensive experiments demonstrate that our algorithm achieves at least comparable utility to the values produced by existing algorithms while significant efficiency improvement. Moreover, we theoretically analyze the Shapley value and justify its advantage over the leave-one-out error as a data value measure.
연구 동기 및 목표
- 대규모 학습 작업에서 정확한 Shapley 값 계산 및 기존 근사 방법의 높은 계산 비용 문제를 해결하기 위해.
- 모델 크기와 무관한 복잡도를 갖는 데이터 가치 평가 방법을 개발하여 실제 데이터셋에 대한 확장성을 확보하기 위해.
- 다양한 기계학습 응용 분야에서 KNN로 근사한 Shapley 값의 성능을 평가하기 위해.
- Shapley 값이 이탈한 한 예측 오차(leave-one-out error)보다 데이터 가치 평가 척도로서 우월함을 이론적으로 정당화하기 위해.
제안 방법
- 기계학습 모델을 국소성 구조를 활용해 효율적인 Shapley 값 계산을 가능하게 하는 K-최근접 이웃(KNN) 분류기로 근사화함으로써.
- KNN의 국소성 특성을 활용해 전체 모델을 재학습하지 않고도 Shapley 값을 계산함으로써, 데이터 크기 비례로 복잡도를 선형 수준으로 감소시킴.
- 각 훈련 예제가 모델 성능에 기여하는 마진널 기여도를 KNN 프록시를 통해 추정하여 데이터 가치 평가의 기반을 마련함.
- 레이블 노이즈 보정, 데이터 요약, 활성 데이터 수집과 같은 하류 작업에 KNN로 근사한 Shapley 값을 적용함.
- KNN의 국소적 추론에 기반하여 반복적인 모델 재학습을 피함으로써, 빠르고 확장 가능한 데이터 가치 평가를 실현함.
실험 결과
연구 질문
- RQ1KNN 기반 프록시는 기존 근사 방법과 비교해 경쟁력 있는 데이터 가치 평가 성능을 달성할 수 있는가?
- RQ2KNN로 근사한 Shapley 값은 이탈한 한 예측 오차보다 데이터 가치 평가 척도로서 이론적으로 우월한가?
- RQ3제안된 방법은 대규모 데이터셋과 복잡한 모델 환경에서 계산 효율성 측면에서 어떻게 확장되는가?
- RQ4실제 기계학습 응용 분야에서 KNN로 근사한 Shapley 값은 실질적인 유용성을 보여주는가?
주요 결과
- KNN 기반 휴리스틱은 레이블 노이즈 보정, 워터마크 탐지, 데이터 요약, 활성 데이터 확보, 도메인 적응 등 다양한 분야에서 기존 근사 알고리즘과 최소한 동등한 성능을 달성한다.
- 계산 비용을 크게 감소시켜 모델 크기와 무관한 복잡도를 확보함으로써 대규모 데이터셋에 대한 확장성을 가능하게 한다.
- 이론적 분석을 통해 Shapley 값이 그 유용한 축약 성질 덕분에 이탈한 한 예측 오차보다 더 나은 데이터 가치 평가 척도임을 확인한다.
- 실험 결과, KNN로 근사한 Shapley 값은 노이즈가 있거나 불균형한 데이터 조건에서도 영향력 있는 훈련 예제를 효과적으로 식별함을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.