Skip to main content
QUICK REVIEW

[논문 리뷰] AdaBits: Neural Network Quantization with Adaptive Bit-Widths

Qing Jin, Linjie Yang|arXiv (Cornell University)|2019. 12. 20.
Advanced Neural Network Applications참고 문헌 50인용 수 17
한 줄 요약

AdaBits는 가중치와 활성화의 가변 비트 폭을 위한 신경망 양자화를 가능하게 하는 공동 학습 접근법을 제안한다. 이는 다양한 하드웨어 제약 조건에 즉각적인 모델 적응을 가능하게 한다. 비트 폭 별로 클리핑 파라미터를 분리하기 위해 스위처블 클리핑 레벨(S-CL)을 도입함으로써, MobileNet V1/V2 및 ResNet50에서 ImageNet을 대상으로 개별적으로 양자화된 모델과 유사한 정확도를 달성하며, 2비트 및 3비트와 같은 낮은 비트 폭에서도 성능 저하가 최소화된다.

ABSTRACT

Deep neural networks with adaptive configurations have gained increasing attention due to the instant and flexible deployment of these models on platforms with different resource budgets. In this paper, we investigate a novel option to achieve this goal by enabling adaptive bit-widths of weights and activations in the model. We first examine the benefits and challenges of training quantized model with adaptive bit-widths, and then experiment with several approaches including direct adaptation, progressive training and joint training. We discover that joint training is able to produce comparable performance on the adaptive model as individual models. We further propose a new technique named Switchable Clipping Level (S-CL) to further improve quantized models at the lowest bit-width. With our proposed techniques applied on a bunch of models including MobileNet-V1/V2 and ResNet-50, we demonstrate that bit-width of weights and activations is a new option for adaptively executable deep neural networks, offering a distinct opportunity for improved accuracy-efficiency trade-off as well as instant adaptation according to the platform constraints in real-world applications.

연구 동기 및 목표

  • 추론 중에 가중치와 활성화의 비트 폭을 동적으로 조정함으로써 딥 신경망의 실시간 하드웨어 적응형 배포를 가능하게 하기.
  • 특히 낮은 비트 폭에서 재학습 없이도 높은 모델 정확도를 유지하는 문제를 해결하기.
  • 다양한 비트 폭으로 공유된 파rameter를 갖는 공동 학습이 개별적으로 학습된 양자화된 모델의 성능을 따라잡을 수 있는지 탐색하기.
  • 특히 클리핑 수준 최적화에서 서로 다른 비트 폭 설정 간의 간섭을 방지하는 메커니즘 개발하기.
  • 비트 폭이 너비, 깊이, 커널 크기 외에도 모델 압축과 적응형 배포에 있어 타당하고 효과적인 자유도로 기능할 수 있는지 입증하기.

제안 방법

  • 모든 파rameter를 비트 폭 전용 클리핑 레벨를 제외하고 공유하는 단일 모델을 사용하여, 동시에 여러 비트 폭을 지원하도록 공동 학습 프레임워크를 제안한다.
  • 각 비트 폭 별로 독립적인 클리핑 레벨 파ram터를 할당하는 메커니즘인 스위처블 클리핑 레벨(S-CL)을 도입하여, 서로 다른 비트 폭 간의 최적화 간섭을 방지한다.
  • 기본 양자화 기반으로 스케일 조정 학습(SAT) 방법을 활용하고, 이를 공동 학습 과정에 통합하여 일관된 양자화 인식 학습을 구현한다.
  • 학습 중 비트 폭 간 전환을 가능하게 하는 미분 가능한 라우팅 메커니즘을 활용하여, 모든 비트 폭 설정에 대한 엔드 투 엔드 최적화를 실현한다.
  • 모델 크기를 줄이기 위해 각 비트 폭 별 양자화된 가중치를 저장하는 대신, 전체 정밀도 가중치만 저장하고 필요에 따라 실시간으로 양자화하는 수정된 기법을 적용한다.
  • 비교를 위해 점진적 학습 전략을 기준으로 삼으며, 비트 폭 순서를 상향 또는 하향으로 학습할 경우 성능 저하 여부를 평가한다.

실험 결과

연구 질문

  • RQ1가중치와 활성화의 다수 비트 폭을 동시에 지원하면서도 모든 설정에서 높은 정확도를 유지할 수 있도록 단일 신경망을 공동 학습시킬 수 있는가?
  • RQ2비트 폭 순서를 상향 또는 하향으로 점진적 학습을 수행할 경우, 높은 비트 폭에서 낮은 비트 폭으로의 미세조정 시 성능 저하가 발생하는가?
  • RQ3비트 폭 전용 클리핑 레벨을 갖는 공유 모델이 2비트 및 3비트와 같은 낮은 비트 폭에서 개별적으로 학습된 모델보다 성능이 뛰어나게 될 수 있는가?
  • RQ4스위처블 클리핑 레벨(S-CL) 메커니즘이 비트 폭 별로 클리핑 파라미터를 분리함으로써 양자화 성능을 어떻게 향상시키는가?
  • RQ5전통적인 모델 압축 기법인 너비 배수 스케일링과 비교할 때, 적응형 비트 폭은 정확도-효율성 트레이드오프를 얼마나 향상시킬 수 있는가?

주요 결과

  • S-CL를 사용한 공동 학습은 MobileNet V1, MobileNet V2, ResNet50에서 모든 비트 폭에 대해 개별적으로 양자화된 모델과 거의 동일한 ImageNet 테스트 정확도를 달성한다.
  • 2비트 ResNet50에서 AdaBits는 S-CL를 사용해 상위-1 정확도 34.1%를 기록했으며, 하향 비트 폭 순서로 진행된 점진적 학습 대비 28.5%로 떨어지는 성능 저하를 극복했다.
  • 4비트 및 3비트 ResNet50에서 AdaBits는 하향 비트 폭 순서 점진적 양자화 대비 정확도를 2.2% 향상시켜 우수한 일반화 능력을 입증했다.
  • S-CL를 적용한 수정된 AdaBits 기법은 보통 AdaBits 대비 4비트 MobileNet V1에서 정확도를 0.3% 향상시켜, 더 나은 클리핑 레벨 관리로 인한 점진적 성과 향상을 보였다.
  • 6비트에서 AdaBits는 전체 정밀도 모델과 유사한 성능을 달성했으며, 모델 크기는 4.74배 감소하고 BitOPs는 14.25배 감소했다. 너비 배수 스케일링(0.35×)은 크기만 2.06배 감소시켜 성능 대비 효율성이 열등했다.
  • S-CL 메커니즘은 각 비트 폭 별 최적의 클리핑 레벨을 제공한다. AB-MobileNet V1의 시각화 결과에서 더 높은 비트 폭일수록 항상 더 큰 클리핑 레벨을 사용하며, 이는 개별 모델의 행동과 일치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.