Skip to main content
QUICK REVIEW

[논문 리뷰] Effective Training of Convolutional Neural Networks with Low-bitwidth Weights and Activations

Bohan Zhuang, Jing Liu|arXiv (Cornell University)|2019. 08. 10.
Advanced Neural Network Applications참고 문헌 91인용 수 9
한 줄 요약

이 논문은 저비트폭 무게와 활성화를 동시에 갖는 컨volution 신경망을 효과적으로 훈련하기 위해 세 가지 새로운 훈련 전략—점진적 양자화, 확률적 정밀도, 공동 지식 정련—을 제안한다. 무게를 점진적으로 양자화한 다음 활성화를 양자화하고, 훈련 오버헤드를 줄이기 위해 단일 단계의 확률적 양자화를 사용하며, 전체 정밀도의 교사와 저정밀도의 학생을 함께 훈련시켜, 2비트 무게와 활성화로 ImageNet과 CIFAR-100에서 최신 기술 수준의 정확도를 달성한다. 이는 기준 모델 대비 최대 3.06%의 상대적 오차 감소를 기록한다.

ABSTRACT

This paper tackles the problem of training a deep convolutional neural network of both low-bitwidth weights and activations. Optimizing a low-precision network is very challenging due to the non-differentiability of the quantizer, which may result in substantial accuracy loss. To address this, we propose three practical approaches, including (i) progressive quantization; (ii) stochastic precision; and (iii) joint knowledge distillation to improve the network training. First, for progressive quantization, we propose two schemes to progressively find good local minima. Specifically, we propose to first optimize a net with quantized weights and subsequently quantize activations. This is in contrast to the traditional methods which optimize them simultaneously. Furthermore, we propose a second progressive quantization scheme which gradually decreases the bit-width from high-precision to low-precision during training. Second, to alleviate the excessive training burden due to the multi-round training stages, we further propose a one-stage stochastic precision strategy to randomly sample and quantize sub-networks while keeping other parts in full-precision. Finally, we adopt a novel learning scheme to jointly train a full-precision model alongside the low-precision one. By doing so, the full-precision model provides hints to guide the low-precision model training and significantly improves the performance of the low-precision network. Extensive experiments on various datasets (e.g., CIFAR-100, ImageNet) show the effectiveness of the proposed methods.

연구 동기 및 목표

  • 저비트폭 무게와 활성화를 동시에 갖는 딥 CNN 훈련의 과제를 해결하기 위해, 양자화 연산의 비미분성으로 인해 발생하는 문제를 해결한다.
  • 성능 향상을 유지하면서 다단계 점진적 양자화의 훈련 부담을 줄이기 위해 노력한다.
  • 전체 정밀도의 교사 네트워크로부터의 지식 정련을 활용하여 저정밀도 네트워크 성능을 향상시킨다.
  • 교수-학습 네트워크를 함께 최적화하여 훈련 중 상호 개선을 가능하게 한다.
  • 다양한 네트워크 아키텍처와 비트폭에 적용 가능한 일반적이고 효과적인 훈련 프레임워크를 개발한다.

제안 방법

  • 두 단계 점진적 양자화 방식을 제안: 먼저 양자화된 무게만을 사용해 훈련하고, 이후 양자화된 활성화를 포함해 미세조정한다.
  • 두 번째 점진적 양자화 방식을 도입: 훈련 도중 전체 정밀도에서 목표 저정밀도로 점진적으로 비트폭을 감소시킨다.
  • 단일 단계의 확률적 정밀도 전략을 개발: 나머지 부분은 전체 정밀도를 유지하면서, 레이어나 블록 등의 하위 네트워크를 무작위로 샘플링하고 양자화함으로써 드롭아웃을 모방하여 기울기 흐름을 향상시킨다.
  • 공동 지식 정련을 도입: 전체 정밀도의 교사와 저정밀도의 학생이 함께 훈련되며, 교사가 출력 로짓이나 특징에 대한 손실 최소화를 통해 학생을 안내한다.
  • 레이블에 대한 교차 엔트로피 손실과 교사-학생 출력 간의 지식 정련 손실을 조합한 공동 훈련 목표를 사용한다.
  • 점진적 양자화, 확률적 정밀도, 공동 지식 정련의 세 구성 요소를 통합하여 최고의 성능을 내는 통합 훈련 프레임워크를 구성한다.

실험 결과

연구 질문

  • RQ1무게와 활성화의 양자화를 분리함으로써 점진적 양자화가 저비트폭 CNN의 최적화와 정확도 향상에 기여할 수 있는가?
  • RQ2단일 단계의 확률적 정밀도 전략이 점진적 양자화의 성능 향상 효과를 유지하면서도 훈련 복잡도를 효과적으로 줄일 수 있는가?
  • RQ3전체 정밀도의 교사와 저정밀도의 학생을 함께 훈련시켜 표준 지식 정련을 초월한 학생 모델의 정확도 향상을 달성할 수 있는가?
  • RQ4제안된 방법들이 결합되었을 때 상호 작용은 어떻게 나타나며, ImageNet과 CIFAR-100과 같은 표준 벤치마크에서 최대 성능 향상은 얼마인가?
  • RQ5제안된 프레임워크는 ResNet, PreResNet, AlexNet 등의 다양한 네트워크 아키텍처와 2비트, 4비트 등의 다양한 비트폭에 일반화 가능한가?

주요 결과

  • ResNet-50와 2비트 무게 및 활성화를 사용한 ImageNet에서, 제안된 방법은 Top-1 정확도 72.40%를 달성하여 기준 모델 대비 3.06% 상대적 향상률을 기록했다.
  • ResNet-50와 2W, 2A에서, 방법은 기준 모델 대비 3.06% 및 DoReFa-Net 기준 모델 대비 2.39%의 Top-1 오차 감소를 기록하며 72.40%의 Top-1 정확도를 달성했다.
  • AlexNet과 2W, 2A를 사용한 CIFAR-100에서, SP와 KD를 적용한 방법은 기준 모델 대비 1.34% 향상된 65.23%의 Top-1 정확도를 기록했다.
  • AlexNet과 2W, 2A를 사용한 ImageNet에서, TS, PP, KD를 적용한 방법은 기준 모델 대비 3.17% 향상된 51.96%의 Top-1 정확도를 기록했다.
  • 공동 지식 정련 전략은 전체 정밀도의 교사와 저정밀도의 학생 네트워크 모두를 동시에 향상시켜 상호 이득을 보였다.
  • 점진적 양자화, 확률적 정밀도, 공동 지식 정련의 세 구성 요소를 모두 결합함으로써 모든 데이터셋과 아키텍처에서 최고의 성능가를 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.