Skip to main content
QUICK REVIEW

[논문 리뷰] Data Pruning via Moving-one-Sample-out

Haoru Tan, Sitong Wu|arXiv (Cornell University)|2023. 10. 23.
Domain Adaptation and Few-Shot Learning인용 수 6
한 줄 요약

이 논문은 이동한 하나의 샘플을 제거하는(MoSo) 새로운 데이터 프루닝 방법을 제안한다. 이 방법은 샘플을 제거했을 때 최적의 경험적 리스크에 미치는 영향을 측정하여 정보량이 적은 샘플을 식별하고 제거한다. 일阶 도함수 기반 근사와 선형 복잡도, 보장된 오차 범위를 활용하여 MoSo는 학습 동역학을 포괄적으로 포착하고, 기존 방법들보다 우수한 성능을 보이며, 특히 높은 프루닝 비율에서 뛰어난 성능을 발휘한다. 또한 다양한 아키텍처에 일반화되며 노이즈가 있는 데이터에 대해 강건하게 대응한다.

ABSTRACT

In this paper, we propose a novel data-pruning approach called moving-one-sample-out (MoSo), which aims to identify and remove the least informative samples from the training set. The core insight behind MoSo is to determine the importance of each sample by assessing its impact on the optimal empirical risk. This is achieved by measuring the extent to which the empirical risk changes when a particular sample is excluded from the training set. Instead of using the computationally expensive leaving-one-out-retraining procedure, we propose an efficient first-order approximator that only requires gradient information from different training stages. The key idea behind our approximation is that samples with gradients that are consistently aligned with the average gradient of the training set are more informative and should receive higher scores, which could be intuitively understood as follows: if the gradient from a specific sample is consistent with the average gradient vector, it implies that optimizing the network using the sample will yield a similar effect on all remaining samples. Experimental results demonstrate that MoSo effectively mitigates severe performance degradation at high pruning ratios and achieves satisfactory performance across various settings.

연구 동기 및 목표

  • 기존의 데이터 프루닝 방법이 어려운 샘플이나 노이즈가 있는 샘플을 진정으로 유익한 샘플들과 혼동하는 한계를 해결하기 위해, 경험적 리스크 변화를 측정하여 샘플 중요도를 평가한다.
  • 샘플 영향을 측정하기 위해 계산 비용이 큰 '하나를 제외한 재학습' 방법에 대한 효율적이고 확장 가능한 대안을 개발한다.
  • 학습 단계 동안의 기울기 일관성 분석을 통해 학습 동역학을 샘플 중요도 평가에 통합한다.
  • 다양한 아키텍처에 걸쳐 프루닝된 데이터셋의 일반화 능력을 향상시키고, 레이블 노이즈 하에서의 강건성을 확보한다.

제안 방법

  • MoSo는 단일 샘플을 훈련 세트에서 제거했을 때 최적의 경험적 리스크가 어떻게 변화하는지 측정함으로써 샘플 중요도를 정의한다. 이는 모델 성능에 기여하는 바를 반영한다.
  • 이 방법은 개별 샘플의 기울기와 훈련 단계 전반의 평균 기울기 간의 기울기 일치를 활용하여, 이 변화를 일阶 근사로 추정한다.
  • 각 훈련 에포크에서 샘플의 기울기와 해당 시점의 기대 기울기 벡터 간의 코사인 유사도를 기반으로 점수를 계산하며, 높은 일치도는 높은 중요도를 의미한다.
  • 이 근사는 선형 시간 복잡도를 달성하고 근사 오차에 대한 이론적 보장을 제공하여 전체 재학습을 피한다.
  • 병렬 처리 방식은 데이터셋을 장치 간에 분할하여, 국소적인 부분집합을 사용해 전역 MoSo 점수를 근사함으로써 확장 가능한 MoSo 점수 계산을 가능하게 한다.
  • MoSo 점수 계산과 함께 서rogate 네트워크 학습을 통합하며, 서rogate 모델을 부분집합으로 학습시켜 효율적인 기울기 계산을 가능하게 한다.
(a) (a) CIFAR-100
(a) (a) CIFAR-100

실험 결과

연구 질문

  • RQ1샘플 제거 시 경험적 리스크 변화를 측정하는 것이 어려움 기반 지표보다 진정으로 정보량이 많은 샘플을 더 잘 식별할 수 있는가?
  • RQ2계산 비용이 큰 '하나를 제외한 재학습' 절차를 정확도를 유지하면서 효율적으로 근사할 수 있는가?
  • RQ3학습 단계 전반에 걸친 기울기 진동을 분석함으로써 학습 동역학을 샘플 중요도 평가에 통합하면 성능 향상이 이루어지는가?
  • RQ4MoSo를 통해 선택된 프루닝 코어 세트는 재학습 없이 다양한 아키텍처에 잘 일반화되는가?
  • RQ5기존의 중요도 기반 프루닝 방법과 비교해 MoSo는 높은 레이블 노이즈 하에서 어떻게 성능을 발휘하는가?

주요 결과

  • MoSo는 CIFAR-100, Tiny-ImageNet, ImageNet-1K에서 최신 기술보다 뛰어난 성능을 보이며, 특히 높은 프루닝 비율에서 두각을 나타낸다. CIFAR-100에서 20% 프루닝 비율일 때 Top-1 정확도 76.58%를 달성한다.
  • MoSo로 선택된 프루닝 코어 세트는 SENet, EfficientNet과 같은 새로운 아키텍처로도 잘 일반화되며, 강력한 전이 성능을 보인다.
  • MoSo는 합성 레이블 노이즈 하에서도 높은 성능 유지를 보이며, 어려움 기반 방법보다 뚜렷한 강건성 우수성을 확보한다.
  • 서rogate 네트워크의 학습 에포크를 100 이상으로 늘려도 성능 향상이 일관되게 이루어지지 않으며, 50에서 200 에포크로 늘였을 때 정확도가 0.82% 뿐 향상되는 것으로 나타나, 근사 오차의 이론적 트레이드오���이 확인된다.
  • 데이터셋을 더 많은 부분집합으로 나누면 프루닝 성능이 향상되며, 이는 더 작은 국소 집합이 개별 샘플의 영향을 더 잘 포착함을 시사한다.
  • MoSo 추정기는 선형 복잡도를 확보하고 근사 오차 보장을 제공하여 대규모 데이터셋에 대해 확장 가능하고 신뢰할 수 있는 성능을 발휘한다.
(b) (b) Tiny-ImageNet
(b) (b) Tiny-ImageNet

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.