[논문 리뷰] Data Valuation Without Training of a Model
이 논문은 두 층으로 구성된 과잉파ram터화된 신경망에서 일반화에 대한 개별 데이터 인스턴스의 영향을 측정하는 훈련 없이 사용할 수 있는 데이터 가치 평가 점수인 복잡도 갭 점수(CG-score)를 제안한다. 데이터를 제거했을 때 발생하는 데이터 복잡도 갭을 측정함으로써, 모델 훈련 없이도 비정상적이거나 잘못 레이블링된 예제를 식별할 수 있으며, 이는 최소한의 정확도 손실로 효과적인 데이터 프루닝을 가능하게 한다. 예를 들어, CIFAR-10에서 40%의 데이터 프루닝을 수행했을 때 정확도 손실이 1% 미만이다.
Many recent works on understanding deep learning try to quantify how much individual data instances influence the optimization and generalization of a model. Such attempts reveal characteristics and importance of individual instances, which may provide useful information in diagnosing and improving deep learning. However, most of the existing works on data valuation require actual training of a model, which often demands high-computational cost. In this paper, we provide a training-free data valuation score, called complexity-gap score, which is a data-centric score to quantify the influence of individual instances in generalization of two-layer overparameterized neural networks. The proposed score can quantify irregularity of the instances and measure how much each data instance contributes in the total movement of the network parameters during training. We theoretically analyze and empirically demonstrate the effectiveness of the complexity-gap score in finding `irregular or mislabeled' data instances, and also provide applications of the score in analyzing datasets and diagnosing training dynamics. Our code is publicly available at https://github.com/JJchy/CG_score
연구 동기 및 목표
- 반복적인 모델 훈련이 필요한 기존 데이터 가치 평가 방법의 높은 계산 비용을 해결하기 위해.
- 개별 데이터 인스턴스가 모델 일반화에 미치는 영향을 측정하는 데이터 중심의 훈련 없음 기반 방법을 개발하기 위해.
- 모델 훈련 없이도 비정상적이거나 잘못 레이블링된 인스턴스를 식별함으로써 효율적인 데이터 프루닝과 데이터셋 진단을 가능하게 하기 위해.
- CG-score가 데이터 비정상성과 학습 난이도를 측정하는 데 있어 이론적이고 경험적으로 검증하기 위해.
제안 방법
- 단일 인스턴스를 데이터셋에서 제거했을 때 발생하는 데이터 복잡도 변화를 기반으로, 데이터 중심의 지표인 복잡도 갭 점수(CG-score)를 정의한다.
- 사전 훈련된 모델의 은닉 표현에 대한 그람 행렬을 활용하여, 전체 행렬 역행렬을 피하기 위해 슈어 보조정식(Schur complement)을 통해 CG-score를 효율적으로 계산한다.
- 무한한 너비의 신경 기능 커널(NTK) 행렬의 역행렬에서 CG-score를 유도하며, 이는 인스턴스 수준의 영향을 캡처하기 위해 역행렬의 대각성분에 집중한다.
- CG-score를 부분적으로 분해하여 내부 클래스 유사도, 외부 클래스 이질성, 인스턴스별 복잡도 기여도를 분석한다.
- CG-score를 사용하여 낮은 점수를 받는 인스턴스를 프루닝 대상으로 선정하고, 손실 곡선과 NTK 부분행렬의 진화를 통해 학습 동역학을 분석한다.
실험 결과
연구 질문
- RQ1훈련 없이도 과잉파라미터화된 네트워크에서 비정상적이거나 잘못 레이블링된 데이터 인스턴스를 효과적으로 식별할 수 있는가?
- RQ2CG-score는 개별 데이터 포인트의 학습 난이도와 학습 동역학과 어떻게 상관관계가 있는가?
- RQ3CG-score에 기반한 데이터 프루닝을 통해 얼마나 잘 모델의 일반화 성능를 유지할 수 있는가?
- RQ4CG-score의 구성 요소 중에서 - 외부 클래스 이질성, 내부 클래스 유사도, 인스턴스 복잡도 중에서 어느 것이 점수 순위에 가장 강하게 영향을 미치는가?
주요 결과
- CG-score는 클래스별 패턴에서의 이격도를 측정함으로써 비정상적이거나 잘못 레이블링된 인스턴스를 효과적으로 식별한다. 높은 점수는 학습하기 어려운 예제를 의미한다.
- CIFAR-10에서 CG-score가 가장 낮은 40%의 데이터 인스턴스를 프루닝했을 때 테스트 정확도 손실가 1% 미만으로 유지되며, 이는 일반화 성능가 잘 보존됨을 보여준다.
- 부분 CG-score 항목 $2y_i(oldsymbol{y}_{-i}^ op oldsymbol{h}_i)$ 는 모든 서브샘플링 비율에서 전체 CG-score와 가장 높은 상관관계(Spearman 순위 >0.96)를 보인다.
- 높은 CG-score를 가진 인스턴스는 더 느린 수렴 속도를 보이며, 낮은 점수를 가진 인스턴스보다 손실 감소가 늦고 NTK 부분행렬의 진화도 지연된다.
- CG-score는 학습 난이도와 강하게 상관되며, 고점수를 가진 인스턴스는 손실 곡선과 정확도 곡선을 통해 학습 중에 더 느리게 학습됨을 확인할 수 있다.
- 그람 행렬의 다양한 서브샘플링 비율에서도 CG-score는 안정적이고 정보가 풍부하여 계산 부담 감소에 대해 강건함을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.