Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient and Robust Quantization-aware Training via Adaptive Coreset Selection

Xijie Huang, Zechun Liu|arXiv (Cornell University)|2023. 06. 12.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 오차 벡터 점수(EVS)와 이견 점수(DS)라는 두 가지 지표를 사용하여 유의미한 학습 샘플을 동적으로 선택하는, 새로운 양자화 인식 학습 방법인 적응형 코어셋 선택(ACS)을 제안한다. 이는 학습 효율성과 정확도를 향상시킨다. 학습 에포크 전반에 걸쳐 이러한 지표들을 적응적으로 균형 잡음으로써, ACS는 단지 ImageNet-1K 데이터의 10%만을 사용함으로써 최신 기술 수준의 성능을 달성하며, 4비트 양자화된 ResNet-18에서 상위-1 정확도 68.39%를 기록하여 무작위 선택 대비 4.24% 향상된 성과를 보였다.

ABSTRACT

Quantization-aware training (QAT) is a representative model compression method to reduce redundancy in weights and activations. However, most existing QAT methods require end-to-end training on the entire dataset, which suffers from long training time and high energy costs. In addition, the potential label noise in the training data undermines the robustness of QAT. We propose two metrics based on analysis of loss and gradient of quantized weights: error vector score and disagreement score, to quantify the importance of each sample during training. Guided by these two metrics, we proposed a quantization-aware Adaptive Coreset Selection (ACS) method to select the data for the current training epoch. We evaluate our method on various networks (ResNet-18, MobileNetV2, RetinaNet), datasets(CIFAR-10, CIFAR-100, ImageNet-1K, COCO), and under different quantization settings. Specifically, our method can achieve an accuracy of 68.39\% of 4-bit quantized ResNet-18 on the ImageNet-1K dataset with only a 10\% subset, which has an absolute gain of 4.24\% compared to the baseline. Our method can also improve the robustness of QAT by removing noisy samples in the training set.

연구 동기 및 목표

  • 대규모 데이터셋에서 양자화 인식 학습(QAT)의 높은 계산 비용과 긴 학습 시간 문제를 해결하기 위해.
  • 학습 데이터셋 내의 데이터 중복성을 활용하여 정확도를 희생시키지 않은 채 QAT의 효율성을 향상시킬 수 있는지 탐구하기 위해.
  • 양자화 모델 학습의 고유한 동역학을 고려하여 QAT에 특화된 코어셋 선택 전략을 개발하기 위해.
  • 손실 기울기와 지식 정렬 동역학을 모두 반영하여 QAT 기간 동안 샘플 중요도를 정확히 반영할 수 있는 지표를 설계하기 위해.
  • 다양한 네트워크와 데이터셋에서 정확도를 유지하거나 향상시키면서도 QAT의 데이터 효율성을 크게 향상시키기 위해.

제안 방법

  • QAT 기간 동안 손실 기울기 분석을 기반으로 샘플 중요도의 이론적 근사치로 오차 벡터 점수(EVS)를 제안한다.
  • 풀 정밀도 모델과 양자화 모델 간의 예측 간격을 측정하기 위해 이견 점수(DS)를 도입하여 지식 정렬 동역학을 반영한다.
  • EVS와 DS의 기여도를 학습 에포크 전반에 걸쳐 적응적으로 균형 잡기 위해 학습 가능한 냉각 전략을 사용하는 적응형 코어셋 선택(ACS) 프레임워크를 설계한다.
  • 초기 학습에는 EVS에 초점을 맞추고, 후기 학습에는 DS에 초점을 맞추기 위해 동적 가중치 기법 $\beta(t)$를 적용하여 데이터 다양성과 수렴성을 향상시킨다.
  • 두 단계 선택 프로세스를 구현한다: 모든 샘플에 대해 EVS와 DS를 계산한 후, 가중 조합을 사용하여 각 에포크당 상위-$k$개 샘플을 선택한다.
  • EVS와 DS의 우선순위를 초기에서 후기 학습으로 부드럽게 전환하기 위해 $\beta(t)$에 코시 냉각 전략을 사용하였으며, 고정 또는 선형 스케줄링보다 뛰어난 성능을 보였다.

실험 결과

연구 질문

  • RQ1양자화 인식 학습 기간 동안 샘플 중요도는 어떻게 변화하는가? 그리고 기울기 기반 지표를 통해 효과적으로 측정할 수 있는가?
  • RQ2오차 벡터 점수(EVS)와 이견 점수(DS)를 결합하면, 단독으로 사용할 경우보다 QAT를 위한 코어셋 선택 성능을 향상시킬 수 있는가?
  • RQ3EVS와 DS의 상대적 가중치를 학습 에포크 전반에 걸쳐 어떻게 조정해야 QAT의 효율성과 정확도를 극대화할 수 있는가?
  • RQ4코어셋 선택을 통해 QAT에서 데이터 사용량을 얼마나 줄일 수 있으며, ImageNet-1K와 CIFAR-100에서 모델 성능을 유지하거나 향상시킬 수 있는가?
  • RQ5QAT의 코어셋 선택 과정에서 EVS와 DS를 균형 잡기 위한 최적의 냉각 전략은 무엇인가?

주요 결과

  • ACS는 ImageNet-1K에서 4비트 양자화된 ResNet-18에 대해 단지 학습 데이터의 10%만을 사용하여 상위-1 정확도 68.39%를 달성하였으며, 이는 무작위 선택 대비 4.24%의 절대적 향상이다.
  • CIFAR-100에서 2비트 가중치 전용 양자화에 대해 ACS는 학습 데이터의 50%만을 사용하여 평균 정확도 67.19%를 기록하였으며, 기준 코어셋 방법을 능가했다.
  • EVS와 DS의 가중치 조정에 대해 코시 냉각 전략이 가장 뛰어난 성능을 보였으며, 고정, 선형, 제곱근, 제곱 전략보다 뛰어났다.
  • 이견 점수(DS)의 분포가 시간이 지남에 따라 0에 수렴하는 경향을 보이며, 이는 모델 수렴도와 지식 정렬 진행 상황을 추적하는 데서 DS의 역할을 확인한다.
  • 시각화 결과, ACS를 사용한 QAT는 랜덤 또는 기준 코어셋 선택 대비 더 매끄럽고 중심 집중적인 손실 지형을 생성함을 확인하였다.
  • 절단 분석 결과, EVS와 DS는 상호 보완적임을 확인하였다: EVS는 작은 데이터 분량에서 뛰어난 성능를 보이며, DS는 더 큰 분량에서 성능 향상을 이끌어낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.