Skip to main content
QUICK REVIEW

[논문 리뷰] Full deep neural network training on a pruned weight budget

Maximilian Golub, Guy Lemieux|arXiv (Cornell University)|2018. 06. 11.
Advanced Neural Network Applications참고 문헌 52인용 수 10
한 줄 요약

이 논문은 훈련 중에 백프로파게이션 동안 가장 기울기 정보가 많은 가중치만 동적으로 추적하고, 추적하지 않은 가중치는 실시간으로 재계산함으로써 메모리 액세스를 크게 줄이는 훈련 시간 프루닝 기법인 Dropback을 소개한다. ResNet18에서 최대 24.4×의 가중치 감소를 달성하면서 정확도 손실이 최소화되고, Densenet 및 WRN과 같은 도전적인 아키텍처에서도 최신 기술 수준의 성능을 기록하며 재훈련이 필요 없는 후기훈련 프루닝 방법을 능가한다.

ABSTRACT

We introduce a DNN training technique that learns only a fraction of the full parameter set without incurring an accuracy penalty. To do this, our algorithm constrains the total number of weights updated during backpropagation to those with the highest total gradients. The remaining weights are not tracked, and their initial value is regenerated at every access to avoid storing them in memory. This can dramatically reduce the number of off-chip memory accesses during both training and inference, a key component of the energy needs of DNN accelerators. By ensuring that the total weight diffusion remains close to that of baseline unpruned SGD, networks pruned using our technique are able to retain state-of-the-art accuracy across network architectures -- including networks previously identified as difficult to compress, such as Densenet and WRN. With ResNet18 on ImageNet, we observe an 11.7$ imes$ weight reduction with no accuracy loss, and up to 24.4$ imes$ with a small accuracy impact.

연구 동기 및 목표

  • DNN 훈련 중에 오프칩 메모리 액세스로 인한 높은 에너지 비용, 특히 모바일 및 임베디드 장치에서의 문제를 해결하기 위해.
  • 특히 밀도가 높고 프루닝이 어려운 네트워크에 대해 정확도를 희생시키지 않은 채 훈련 메모리 피드백과 대역폭을 줄이기 위해.
  • 프루닝 후 재훈련이 필요 없도록 프루닝을 훈련 과정에 직접 통합함으로써 후기훈련 재훈련의 필요성을 제거하기 위해.
  • 지속적인 가중치 저장을 최소화함으로써 더 큰 모델 훈련이나 저용량 하드웨어에서의 재훈련을 가능하게 하기 위해.

제안 방법

  • Dropback은 백프로파게이션 동안 누적 기울기가 가장 높은 가중치만 선택하고 추적하며, 나머지는 메모리에서 프루닝한다.
  • 추적하지 않은 가중치는 초기 값으로 실시간으로 재생성하여 지속적인 저장 및 오프칩 메모리 액세스를 방지한다.
  • 알고리즘은 모든 가중치를 초기화하지만, 훈련 단계 전반에 걸쳐 총 기울기 크기가 가장 큰 가중치들만 업데이트한다.
  • 높은 기울기 가중치가 학습 동역학을 지배하므로, 가중치 확산이 전체 SGD와 유사하게 유지됨을 활용한다.
  • 배치 정규화 및 퍼라메트릭 ReLU 레이어와 같은 일반적으로 프루닝에서 제외되는 레이어와도 호환된다.
  • 훈련 중에만 작동하며 후기훈련 재훈련이 필요 없으며, 양자화 및 압축 기법과 수직적(orthogonal)으로 작용한다.

실험 결과

연구 질문

  • RQ1훈련 중에 프루닝을 적용함으로써 DNN 훈련의 메모리 피드백을 줄일 수 있을까? 정확도 손실 없이 가능할까?
  • RQ2오직 높은 기울기 가중치만 프루닝할 경우, 전체 SGD와 비교해 가중치 확산과 모델 수렴에 어떤 영향을 미칠까?
  • RQ3DenseNet 및 WRN과 같은 밀도 높은 아키텍처에서 Dropback은 후기훈련 프루닝 방법보다 더 뛰어난 압축률과 정확도를 달성할 수 있을까?
  • RQ4저전력 훈련 환경에서 Dropback은 오프칩 메모리 액세스와 에너지 소비를 얼마나 줄일 수 있을까?
  • RQ5배치 정규화 및 PReLu와 같은 레이어에 이 기법을 적용할 수 있을까? 일반적으로 프루닝에서 제외되는 레이어에 대해서도 가능할까?

주요 결과

  • ImageNet을 사용한 ResNet18에서 Dropback은 정확도 손실 없이 11.7×의 가중치 감소를 달성했고, 소량의 정확도 영향을 감안할 경우 최대 24.4×까지 감소시켰다.
  • Densenet에서는 4.5×의 가중치 감소로 5.86%의 검증 오차를 기록했으며, 이는 이전 방법들(5.65% / 2.9×)을 능가한다.
  • WRN-28-10에서는 3.85–4.20%의 오차를 기록했고, 4.5×–7.3×의 가중치 감소를 달성했으며, 이는 이전 최고 성능 결과(16.6% 오차 / 4× 감소)를 뛰어넘었다.
  • Dropback은 전체 SGD와 유사한 가중치 확산 프로필을 유지하여, 프루닝 후 재훈련 없이도 높은 정확도를 확보한다.
  • 추적하지 않은 가중치의 저장을 피함으로써 메모리 액세스 비용을 줄여, 저용량 장치에서의 훈련을 가능하게 한다.
  • Dropback은 양자화 및 압축 기법과 수직적으로 작용하므로, 추가적인 메모리 감소를 위해 이들과 조합할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.