Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Data Pruning under Label Noise via Maximizing Re-labeling Accuracy

Dongmin Park, Seola Choi|arXiv (Cornell University)|2023. 11. 02.
Music and Audio Processing인용 수 4
한 줄 요약

이 논문은 레이블 노이즈 하에서 재라벨링 정확도를 향상시키기 위해 이웃 예측의 신뢰도를 최대화함으로써 훈련 데이터를 선택하는 새로운 데이터 프루닝 방법인 Prune4ReL을 제안한다. 이웃 예측의 신뢰도를 높이는 예제를 우선순위에 두어, 기준선 대비 재라벨링 성능을 최대 9.1% 향상시키고, 노이즈가 있는 데이터셋에서 일반화 성능을 최대 21.6% 향상시킨다.

ABSTRACT

Data pruning, which aims to downsize a large training set into a small informative subset, is crucial for reducing the enormous computational costs of modern deep learning. Though large-scale data collections invariably contain annotation noise and numerous robust learning methods have been developed, data pruning for the noise-robust learning scenario has received little attention. With state-of-the-art Re-labeling methods that self-correct erroneous labels while training, it is challenging to identify which subset induces the most accurate re-labeling of erroneous labels in the entire training set. In this paper, we formalize the problem of data pruning with re-labeling. We first show that the likelihood of a training example being correctly re-labeled is proportional to the prediction confidence of its neighborhood in the subset. Therefore, we propose a novel data pruning algorithm, Prune4Rel, that finds a subset maximizing the total neighborhood confidence of all training examples, thereby maximizing the re-labeling accuracy and generalization performance. Extensive experiments on four real and one synthetic noisy datasets show that \algname{} outperforms the baselines with Re-labeling models by up to 9.1% as well as those with a standard model by up to 21.6%.

연구 동기 및 목표

  • 기존 방법이 재라벨링 능력을 고려하지 못하는 데서 비롯된 데이터 프루닝의 격차를 해소한다.
  • 모델 일반화뿐 아니라 모든 예제의 재라벨링 정확도를 최대화하는 훈련 서브셋 선택이라는 새로운 문제를 정식화한다.
  • 완전한 모델 훈련 이전에 재라벨링 잠재력을 추정하는 과제를 극복한다.
  • 노이즈 있는 레이블의 자가보정을 향상시키기 위해 총 이웃 신뢰도를 최대화하는 서브셋을 효율적이고 확장 가능한 방식으로 식별하는 방법을 개발한다.

제안 방법

  • 재라벨링 잠재력의 대체 지표로, 선택된 서브셋 내 이웃의 예측 신뢰도의 합인 '감소된 이웃 신뢰도' 개념을 도입한다.
  • 이론적 및 실험적으로 높은 이웃 신뢰도가 올바른 재라벨링 가능성을 높인다는 것을 입증한다.
  • 모든 훈련 예제에 대해 총 이웃 신뢰도 커버리지가 최대가 되도록 프루닝 목적을 설정한다.
  • 총 이웃 신뢰도에 가장 기여하는 예제를 반복적으로 추가하는 그레디 선택 알고리즘을 설계한다.
  • 서브셋 선택 과정에서 전체 모델 재학습을 피하기 위해 확장성 향상을 도모하여 ImageNet-N과 같은 대규모 데이터셋에 적용 가능하게 한다.
  • 재라벨링 모델(예: DivideMix, SOP+)과 통합하여 노이즈 하에서 종단 간 성능을 평가한다.

실험 결과

연구 질문

  • RQ1선택된 서브셋에서의 이웃 신뢰도는 노이즈가 있는 예제에 대해 올바른 재라벨링 가능성을 예측할 수 있는가?
  • RQ2모델 일반화뿐 아니라 재라벨링 정확도를 최대화하는 데 초점을 맞춘 서브셋을 선택하는 방식으로 데이터 프루닝을 재정의할 수 있는가?
  • RQ3완전한 검색이나 전체 모델 훈련 없이도 그러한 서브셋을 효율적이고 확장 가능한 방식으로 식별할 수 있는가?
  • RQ4이웃 신뢰도를 최대화하면 레이블 노이즈 하에서 재라벨링 정확도와 최종 모델 성능에 측정 가능한 향상이 이루어지는가?

주요 결과

  • Prune4ReL은 네 가지 실제 노이즈가 있는 데이터셋(CIFAR-10N, CIFAR-100N, WebVision, Clothing-1M)에서 재라벨링 모델과 함께 사용했을 때 기준선 8종에 비해 최대 9.1% 높은 테스트 정확도를 기록했다.
  • 20%의 합성 레이블 노이즈가 있는 ImageNet-N에서, 선택 비율이 0.05에서 0.4에 이르는 범위에서 기준선 대비 최대 8.6% 높은 정확도를 달성했다.
  • 선택된 서브셋에서 자가보정이 불가능한 노이즈가 있는 예제 비율을 줄였다. CIFAR-10N(Random)에서 90.3%의 정확한 재라벨링을 달성했고, Forget은 61.7%, kCenter는 75.2%였다.
  • 낮은 선택 비율(예: 0.05)에서도 높은 성능을 유지하여 확장성과 강인성을 입증했다.
  • 노이즈가 있는 데이터셋에서 재라벨링 모델과 함께 사용했을 때, 표준 프루닝 기준선 대비 최대 21.6% 높은 정확도 향상을 기록했다.
  • 그레디 알고리즘이 ImageNet-N(120만 개 예제)과 같은 대규모 데이터셋에서도 효율적으로 확장 가능함을 입증하여 계산 가능성도 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.