Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Sustainable Learning: Coresets for Data-efficient Deep Learning

Yang Yu, Hao Kang|arXiv (Cornell University)|2023. 06. 02.
Advanced Neural Network Applications인용 수 4
한 줄 요약

Crest는 비선형 손실을 조각별로 이차 근사로 모델링하고 반복적으로 랜덤 서브셋에서 코어셋을 업데이트함으로써, 깊이 신경망의 고가치 학습 예제를 동적으로 선별하는 확장성 있고 이론적으로 탄탄한 프레임워크이다. 비선형 손실을 조각별로 이차 근사로 모델링하고 반복적으로 랜덤 서브셋에서 코어셋을 업데이트함으로써, 훈련 속도를 1.7배에서 2.5배로 가속화하면서 정확도 저하를 최소화하며, 확률적 경사 하강법에서 정류점으로의 수렴을 보장한다.

ABSTRACT

To improve the efficiency and sustainability of learning deep models, we propose CREST, the first scalable framework with rigorous theoretical guarantees to identify the most valuable examples for training non-convex models, particularly deep networks. To guarantee convergence to a stationary point of a non-convex function, CREST models the non-convex loss as a series of quadratic functions and extracts a coreset for each quadratic sub-region. In addition, to ensure faster convergence of stochastic gradient methods such as (mini-batch) SGD, CREST iteratively extracts multiple mini-batch coresets from larger random subsets of training data, to ensure nearly-unbiased gradients with small variances. Finally, to further improve scalability and efficiency, CREST identifies and excludes the examples that are learned from the coreset selection pipeline. Our extensive experiments on several deep networks trained on vision and NLP datasets, including CIFAR-10, CIFAR-100, TinyImageNet, and SNLI, confirm that CREST speeds up training deep networks on very large datasets, by 1.7x to 2.5x with minimum loss in the performance. By analyzing the learning difficulty of the subsets selected by CREST, we show that deep models benefit the most by learning from subsets of increasing difficulty levels.

연구 동기 및 목표

  • 대규모 데이터셋에서 대규모 딥러닝 모델을 훈련하는 데 드는 비합리적인 계산 비용과 탄소 배출량을 해결하기 위해.
  • 특히 딥 네트워크를 포함한 비선형 모델에 대해 엄밀한 이론적 수렴 보장을 제공하는 코어셋 프레임워크를 개발하기 위해.
  • 낮은 편향과 분산을 유지하면서 (미니배치) SGD와의 호환성을 확보하기 위해.
  • 후기 훈련 단계에서 이미 학습된 예제를 코어셋 선택에서 제외함으로써 확장성과 효율성을 향상시키기 위해.
  • 제한된 훈련 예산 하에서 다양한 시각 및 NLP 벤치마크에서 방법의 실증적 검증을 위해.

제안 방법

  • Crest는 현재 모델 파라미터 주변에서 비선형 손실을 이차 함수의 시퀀스로 모델링하여 진짜 손실과 기울기의 局소 근사를 가능하게 한다.
  • 각 이차 부분 영역에 대해 전체 기울기와 밀도 높은 근사치를 갖는 코어셋을 선별함으로써, 훈련 전반에 걸쳐 기울기 오차가 유한하게 유지됨을 보장한다.
  • (미니배치) SGD를 지원하기 위해 Crest는 데이터의 다수의 랜덤 서브셋을 샘플링하고 각각에서 미니배치 코어셋을 추출함으로써, 편향이 거의 없고 분산이 작은 기울기를 확보한다.
  • 프레임워크는 이차 근사의 타당성에 따라 코어셋을 동적으로 업데이트하며, 훈련이 진행됨에 따라 근사가 더 국소적으로 선형화되므로 업데이트 빈도를 감소시킨다.
  • 기울기가 거의 0인(즉, 이미 학습된) 예제를 코어셋 선택에서 식별하고 제외함으로써, 후기 훈련 단계에서의 효율성을 향상시킨다.
  • Crest는 기울기와 곡률의 부드러운 근사를 사용하여 이차 모델링을 안정화시키고 코어셋 업데이트 중 불안정성을 방지한다.

실험 결과

연구 질문

  • RQ1비선형 딥러닝 모델에 대해 정류점으로의 증명 가능한 수렴 보장을 갖춘 코어셋 프레임워크를 설계할 수 있는가?
  • RQ2코어셋 선택을 (미니배치) 확률적 경사 하강법과 호환되게 하면서 기울기 편향과 분산을 낮출 수 있는가?
  • RQ3대규모 딥러닝 데이터셋에 대한 코어셋 선택의 확장성과 효율성을 향상시키기 위한 전략은 무엇인가?
  • RQ4선택된 예제의 학습 난이도는 훈련 중 어떻게 변화하며, 코어셋 선택은 더 어려운 예제에 적응적으로 집중할 수 있는가?
  • RQ5이미 학습된 예제를 제외함으로써 코어셋 선택 성능과 훈련 속도는 어느 정도 향상되는가?

주요 결과

  • Crest는 ResNet20을 CIFAR-10에서, ResNet18을 CIFAR-100에서, ResNet-50를 TinyImageNet에서, RoBERTa를 SNLI에서 테스트한 여러 시각 및 NLP 벤치마크에서 1.7배에서 2.5배의 훈련 속도 향상을 달성하며, 성능 저하가 최소한이었다.
  • 기본값보다 코어셋 업데이트 횟수를 46% 감소시켰지만 더 높은 최종 정확도를 달성했다.
  • 이미 학습된 예제를 제외함으로써 훈련 효율성과 모델 성능이 향상되었으며, 이러한 예제를 제외하지 않은 경우 대비 상대 오차가 4.33%에서 4.61%로 감소했다.
  • Crest는 시간이 지남에 따라 학습 난이도가 증가하는 예제를 선택함을 보여주었으며, 평균 망각 점수의 상승으로부터 더 어려운 학습 대상에 집중함을 입증했다.
  • 이차 근사 전략 덕분에 근사가 유지되는 이웃 영역의 크기를 늘릴 수 있었고, 이로 인해 훈련이 진행됨에 따라 코어셋 업데이트 빈도가 감소했다.
  • Crest는 무작위 샘플링과 Craig 기반 코어셋 선택보다 뛰어나며, 코어셋 선택 시간에서 13배의 속도 향상을 보였다(Craig 대비 0.006초 대비 0.089초/업데이트).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.