Skip to main content
QUICK REVIEW

[논문 리뷰] AC/DC: Alternating Compressed/DeCompressed Training of Deep Neural Networks

Alexandra Peşte, Eugenia Iofinova|arXiv (Cornell University)|2021. 06. 23.
Advanced Neural Network Applications참고 문헌 53인용 수 11
한 줄 요약

AC/DC는 고정된 지지 집합을 기반으로 밀도 높은 모델과 희소 모델을 번갈아가며 훈련하는 새로운 교대 압축/해제 압축 훈련 방법을 제안한다. 이 방법은 부드러운 비볼록 목표 함수 하에서 수렴 보장을 보장하면서도, 높은 희소성 수준에서도 기존의 희소 훈련 방법과 후처리 희소화를 능가하는 최신 기술 수준의 정확도를 달성한다.

ABSTRACT

The increasing computational requirements of deep neural networks (DNNs) have led to significant interest in obtaining DNN models that are sparse, yet accurate. Recent work has investigated the even harder case of sparse training, where the DNN weights are, for as much as possible, already sparse to reduce computational costs during training. Existing sparse training methods are often empirical and can have lower accuracy relative to the dense baseline. In this paper, we present a general approach called Alternating Compressed/DeCompressed (AC/DC) training of DNNs, demonstrate convergence for a variant of the algorithm, and show that AC/DC outperforms existing sparse training methods in accuracy at similar computational budgets; at high sparsity levels, AC/DC even outperforms existing methods that rely on accurate pre-trained dense models. An important property of AC/DC is that it allows co-training of dense and sparse models, yielding accurate sparse-dense model pairs at the end of the training process. This is useful in practice, where compressed variants may be desirable for deployment in resource-constrained settings without re-doing the entire training flow, and also provides us with insights into the accuracy gap between dense and compressed models. The code is available at: https://github.com/IST-DASLab/ACDC .

연구 동기 및 목표

  • 기존 희소 훈련 방법에서 이론적 수렴 보장의 부족을 해결하기 위해.
  • 훈련 중 희소 모델과 밀도 높은 모델 간의 정확도 격차를 줄이기 위해.
  • 단일 훈련 과정에서 정확도가 높은 희소 및 밀도 높은 모델을 공훈련할 수 있도록 하기 위해.
  • 높은 정확도를 유지하면서 계산 비용을 줄이는 실용적이고 효율적인 훈련 제도를 제공하기 위해.
  • 공훈련 중 희소 및 밀도 높은 모델 예측 간의 상관관계를 이해하기 위해.

제안 방법

  • AC/DC는 고정된, 사전 정렬된 가중치 지지 집합을 기반으로 표준 밀도 높은 훈련 단계와 희소 최적화 단계를 번갈아 수행한다.
  • 희소 단계 동안은 절단 마스크에 의해 결정된 가중치 하위 집합만 업데이트되고, 나머지는 0으로 고정되어 FLOP 절감이 가능하다.
  • 이 방법은 부드러운 비볼록 목표 함수 하에서 수렴을 보장하기 위해 반복적 하드 테이프링(IHT) 원리를 사용한다.
  • 훈련 과정은 표준 훈련과 동일한 초모수(예: 학습률, 배치 크기)를 사용하며, 단계 길이는 표준 값(예: 5–10 에포크)으로 설정된다.
  • 최종으로 반환되는 모델은 마지막 희소 단계에서의 희소 모델이며, 마지막 밀도 높은 단계에서의 밀도 높은 모델은 밀도 높은 기준 정확도를 맞추기 위해 미세조정된다.
  • 스파arsity 스케줄은 연속된 단계 간의 마스크 차이를 최소화하도록 설계되어 모델 품질을 향상시킨다.

실험 결과

연구 질문

  • RQ1밀도 높은 및 희소 단계를 번갈아 수행하는 희소 훈련 방법이 부드러운 비볼록 목표 함수에 대해 이론적 수렴을 달성할 수 있는가?
  • RQ2희소 및 밀도 높은 모델의 공훈련이 희소 및 밀도 높은 기준 모델 간의 정확도 격차를 줄이는가?
  • RQ3AC/DC는 고도의 희소성 수준에서 후처리 희소화 및 기존의 희소 훈련 방법을 능가할 수 있는가?
  • RQ4단계 길이와 스파arsity 스케줄은 모델 정확도와 계산 효율성에 어떤 영향을 미치는가?
  • RQ5공훈련 중 희소 및 밀도 높은 모델의 개별 예측 간의 관계는 어떠한가?

주요 결과

  • AC/DC는 ResNet50를 사용해 ImageNet에서 90% 희소성 수준에서 75.18%의 top-1 정확도를 달성했으며, 기존의 희소 훈련 방법을 능가하고 고도의 희소성 수준에서 후처리 희소화와 유사하거나 이를 초월한다.
  • AC/DC에서 미세조정된 밀도 높은 모델은 76.87%의 정확도를 기록하여 밀도 높은 기준 모델과 매우 유사한 성능을 보이며 효과적인 공훈련을 입증한다.
  • 100 에포크 동안 매 10 에포크마다 단계를 번갈아 수행하는 AC/DC는 밀도 높은 기준 대비 0.7× 훈련 FLOPs를 기록하며 정확도 손실가 최소화된다.
  • 더 긴 최종 복원 단계는 미세조정된 밀도 높은 모델의 정확도를 향상시키며, 이는 연장된 미세조정이 모델 복구를 향상시킨다는 것을 시사한다.
  • 연속된 단계 간에 비트라이비얼 마스크 차이가 있는 스파arsity 스케줄은 더 나은 희소 모델 성능을 이끌어낸다.
  • FP16를 사용한 혼합 정밀도 훈련은 FP32 대비 AC/DC에서 0.2–0.3%의 정확도 손실을 유발하며, 이는 교대 제도에서 정밀도에 민감함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.