Skip to main content
QUICK REVIEW

[논문 리뷰] LAVA: Data Valuation without Pre-Specified Learning Algorithms

Hoang Anh Just, Feiyang Kang|arXiv (Cornell University)|2023. 04. 28.
Privacy-Preserving Technologies in Data인용 수 6
한 줄 요약

LAVA는 사전에 지정된 학습 알고리즘에 의존하지 않고 데이터 값을 할당하는 학습에 관계없는 데이터 평가 프레임워크를 도입한다. 검증 성능의 대체 지표로 클래스별 워셔스타인 거리를 사용하며, 이 거리의 민감도 분석을 통해 데이터 값을 계산함으로써 빠르고 확장 가능하며 강건한 평가를 가능하게 하여, 기존 최고 수준의 방법들보다 저품질 데이터 탐지에서 뛰어난 성능을 보이며, 기존 방법들보다 수십 배에서 수백 배 빠르다.

ABSTRACT

Traditionally, data valuation (DV) is posed as a problem of equitably splitting the validation performance of a learning algorithm among the training data. As a result, the calculated data values depend on many design choices of the underlying learning algorithm. However, this dependence is undesirable for many DV use cases, such as setting priorities over different data sources in a data acquisition process and informing pricing mechanisms in a data marketplace. In these scenarios, data needs to be valued before the actual analysis and the choice of the learning algorithm is still undetermined then. Another side-effect of the dependence is that to assess the value of individual points, one needs to re-run the learning algorithm with and without a point, which incurs a large computation burden. This work leapfrogs over the current limits of data valuation methods by introducing a new framework that can value training data in a way that is oblivious to the downstream learning algorithm. Our main results are as follows. (1) We develop a proxy for the validation performance associated with a training set based on a non-conventional class-wise Wasserstein distance between training and validation sets. We show that the distance characterizes the upper bound of the validation performance for any given model under certain Lipschitz conditions. (2) We develop a novel method to value individual data based on the sensitivity analysis of the class-wise Wasserstein distance. Importantly, these values can be directly obtained for free from the output of off-the-shelf optimization solvers when computing the distance. (3) We evaluate our new data valuation framework over various use cases related to detecting low-quality data and show that, surprisingly, the learning-agnostic feature of our framework enables a significant improvement over SOTA performance while being orders of magnitude faster.

연구 동기 및 목표

  • 기존 데이터 평가 방법들이 특정 학습 알고리즘에 의존하는 한계를 해결함으로써, 초기 단계의 데이터 수집 및 데이터 마켓플레이스에서의 활용을 가능하게 하기 위해.
  • 모델 성능 지표에 의존하는 방식으로 모델 재학습이 필요한 이탈-일괄 또는 협력 게임 이론 기반 평가의 계산 부담을 제거하기 위해.
  • 데이터 중복 및 노이즈에 강건한 데이터 평가 방법을 개발하여, 데이터가 복제되거나 변형되어도 안정적인 값을 유지하도록 하기 위해.
  • 추가 학습 없이도 표준 최적화 솔버를 직접 활용해 효율적이고 확장 가능한 데이터 평가를 가능하게 하기 위해.
  • 모델 선택 또는 하이퍼파rameter 튜닝 이전에도 적용 가능한 분포 기반 일반 목적의 데이터 평가 프레임워크를 제공하기 위해.

제안 방법

  • 학습 세트와 검증 세트 간의 비표준 클래스별 워셔스타인 거리를 모델 일반화 성능의 대체 지표로 제안한다.
  • 특징-라벨 쌍 간의 분포 이탈을 캡처하기 위해, 유클리드-워셔스타인 혼합 비용 함수를 사용한다.
  • 모델 클래스에 대한 리프시츠 연속성 가정을 기반으로 검증 성능에 대한 이론적 경계를 수립한다.
  • 개별 데이터 포인트의 확률 질량에 대한 워셔스타인 거리의 민감도 분석을 통해 데이터 값을 유도한다.
  • 추가 비용 없이도 거리와 데이터 값을 동시에 계산할 수 있도록 표준 최적 운반 솔버(예: geomloss, otdd)를 활용한다.
  • 분포 기반 수식을 도입하여 중복 데이터 포인트를 자연스럽게 무시하고, 소규모 특징 또는 라벨 변형에 대해 강건함을 확보한다.

실험 결과

연구 질문

  • RQ1어떤 후행 학습 알고리즘에 의존하지 않는 데이터 평가 프레임워크를 설계할 수 있는가?
  • RQ2학습 세트와 검증 세트 간의 클래스별 워셔스타인 거리를 사용해 모델의 일반화 성능을 효과적으로 대체 지표로 활용할 수 있는가?
  • RQ3모델 재학습 없이도 이 거리의 민감도 분석을 통해 데이터 값을 효율적이고 정확하게 계산할 수 있는가?
  • RQ4기존 최고 수준의 방법들과 비교해, LAVA는 오염되거나 잘못 레이블링되거나 노이즈가 있는 예제와 같은 저품질 데이터 탐지에서 어떻게 성능을 발휘하는가?
  • RQ5이 프레임워크는 데이터 중복 및 소규모 변형에 강건한가? 이는 실세계의 데이터 마켓플레이스에 적합한가?

주요 결과

  • LAVA는 여러 벤치마크에서 잘못 레이블링된, 오염된, 노이즈가 있는 데이터를 포함한 저품질 데이터 탐지에서 최고 수준의 성능을 달성한다.
  • 기존의 학습 의존적 데이터 평가 방법들보다 최대 100배 빠르며, 실행 시간이 데이터셋 크기에 선형적으로 증가한다.
  • 데이터 중복이 발생하더라도 클래스별 워셔스타인 거리는 변화하지 않아 복제에 대해 강건함을 입증한다.
  • 소규모 특징 또는 라벨 변형이 거리에 미치는 영향이 미미하여, 노이즈에 대해 안정적임을 나타낸다.
  • 민감도 분석을 통해 계산된 데이터 값은 표준 최적 운반 솔버에서 직접 확보 가능하며 추가 계산이 필요하지 않다.
  • ImageNet-100 실험에서 LAVA는 25%의 잘못 레이블링된 데이터가 존재하는 상황에서도 높은 정확도를 유지하며, 이전 방법들보다 탐지율에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.