Skip to main content
QUICK REVIEW

[논문 리뷰] BatchQuant: Quantized-for-all Architecture Search with Robust Quantizer

Haoping Bai, Meng Cao|arXiv (Cornell University)|2021. 05. 19.
Machine Learning and Algorithms참고 문헌 41인용 수 14
한 줄 요약

이 논문은 재학습 없이 아키텍처와 임의의 초저해상도 비트폭을 동시에 탐색할 수 있는 새로운 일회성 혼합 정밀도 신경망 구조 탐색 프레임워크인 Quantized-for-All (QFA)을 제안한다. BatchQuant라는 강력한 배치 통계 기반 양자화기 도입으로, 단순한 가중치 공유 슈퍼넷의 훈련을 안정화시켰으며, 단지 190 GPU 에포크만으로 20 MFLOPs 이하에서 최고 성능을 달성하고, 하나의 슈퍼넷으로부터 10^76개 이상의 양자화된 서브넷을 배포 가능하게 했다.

ABSTRACT

As the applications of deep learning models on edge devices increase at an accelerating pace, fast adaptation to various scenarios with varying resource constraints has become a crucial aspect of model deployment. As a result, model optimization strategies with adaptive configuration are becoming increasingly popular. While single-shot quantized neural architecture search enjoys flexibility in both model architecture and quantization policy, the combined search space comes with many challenges, including instability when training the weight-sharing supernet and difficulty in navigating the exponentially growing search space. Existing methods tend to either limit the architecture search space to a small set of options or limit the quantization policy search space to fixed precision policies. To this end, we propose BatchQuant, a robust quantizer formulation that allows fast and stable training of a compact, single-shot, mixed-precision, weight-sharing supernet. We employ BatchQuant to train a compact supernet (offering over $10^{76}$ quantized subnets) within substantially fewer GPU hours than previous methods. Our approach, Quantized-for-all (QFA), is the first to seamlessly extend one-shot weight-sharing NAS supernet to support subnets with arbitrary ultra-low bitwidth mixed-precision quantization policies without retraining. QFA opens up new possibilities in joint hardware-aware neural architecture search and quantization. We demonstrate the effectiveness of our method on ImageNet and achieve SOTA Top-1 accuracy under a low complexity constraint ($<20$ MFLOPs). The code and models will be made publicly available at https://github.com/bhpfelix/QFA.

연구 동기 및 목표

  • 자원 제약이 있는 엣지 배포 환경에서 광범위한 혼합 정밀도 양자화 및 아키텍처 공간을 동시에 탐색하는 도전 과제 해결.
  • 가중치 공유 슈퍼넷의 혼합 정밀도 훈련에서 발생하는 불안정성 문제를 해결하여, 양자화를 포함한 효율적인 일회성 NAS를 가능하게 함.
  • 검색된 양자화된 서브넷을 배포할 때 재학습 또는 피팅 조정이 필요 없도록 하여 새로운 시나리오에 빠르게 적응 가능하게 함.
  • 층별로 임의의 비트폭 조합을 유연하게 허용함으로써, 낮은 FLOP 제약 조건에서도 최고 성능을 달성.
  • 새로운 배포 시나리오당 최소한의 GPU 시간과 탄소 배출량을 확보하여 탐색 비용과 탄소 발자국을 최소화함.

제안 방법

  • 배치 통계를 사용해 스케일 인자를 적응적으로 추정하는 플러그 앤 플레이형 양자화기인 BatchQuant(BQ)를 제안하여, 혼합 정밀도 서브넷 선택 시 활성화 분포 이탈에 대한 강건성을 향상시킴.
  • 기존의 러닝 최소/최대값을 대체하는 미분 가능하고 배치 기반의 분위수 추정 방법을 사용하는 새로운 극값 추정기(식 8) 도입으로 훈련 안정성 향상.
  • 아키텍처 및 비트폭 선택에 따른 파라미터 공유를 통해 10^76개 이상의 고유한 양자화된 서브넷을 지원하는 단일이고 컴act한 혼합 정밀도 가중치 공유 슈퍼넷 훈련.
  • NSGA-II를 활용해 파레토 최적 아키텍처 탐색을 수행하여 다양한 양자화 정책 하에서 정확도와 FLOPs를 동시에 최적화.
  • 비용이 많이 드는 평가를 피하기 위해 소규모 검증 세트 기반의 경량 정확도 예측기 도입으로, 신속하고 확장 가능한 탐색 가능.
  • 전체 정밀도 가중치를 유지하면서 각 서브넷에 따라 동적으로 양자화기를 융합하는 슈퍼넷 훈련 파이프라인에 BQ 통합하여 재학습이 없는 인퍼런스 구현.

실험 결과

연구 질문

  • RQ1임의의 비트폭을 갖는 층에서 혼합 정밀도 양자화를 적용한 단일 통합 슈퍼넷을 재학습 없이 안정적으로 훈련시킬 수 있는가?
  • RQ2슈퍼넷 훈련 중 동적 양자화 정책 선택으로 인한 활성화 분포 이탈을 양자화기 설계가 어떻게 완화할 수 있는가?
  • RQ3기존의 러닝 최소/최대값 또는 학습 가능한 양자화기 기반 베이스라인 대비 제안된 BatchQuant 설정이 훈련 안정성과 수렴성에서 얼마나 향상되는가?
  • RQ4단일 슈퍼넷을 통한 아키텍처 및 양자화 정책의 공동 탐색이 재학습 없이 엄격한 FLOP 제약(예: 20 MFLOPs 이하) 하에서도 최고 성능을 달성할 수 있는가?
  • RQ5이 방법을 사용해 동적 엣지 환경에서 새로운 양자화 모델을 배포할 때의 마진 비용과 탄소 배출량은 얼마인가?

주요 결과

  • BatchQuant는 190 GPU 에포크 내에 수렴하는 혼합 정밀도 가중치 공유 슈퍼넷을 안정적으로 훈련시켰으며, 10^76개 이상의 가능한 양자화된 서브넷을 지원함. 이는 OQA의 495 에포크 대비 현저히 적은 수치.
  • 20 MFLOPs 이하에서 ImageNet Top-1 정확도를 최고 수준으로 달성하여, 정확도 대비 FLOPs 성능 트레이드오프에서 APQ 및 SPOS를 크게 앞서나감.
  • 새로운 배포 시나리오에서의 탐색에 따른 탄소 배출량은 극히 미미함(0 lbs), 初기 슈퍼넷 훈련 이후 추가로 40시간의 데이터 수집 및 훈련만 필요함.
  • BQ에서 잔여 항목 γ 및 β를 제거하면 훈련 손실이 발산함을 확인하여, 이들이 양자화 과정의 안정성에 결정적인 역할을 함을 입증.
  • 식 8(배치 기반 극값 추정기)만이 안정적인 훈련을 가능하게 하며, 식 7 및 9는 발산을 유도함으로써 통계적 공식의 중요성을 입증.
  • QFA 프레임워크는 검색 후 재학습 또는 피팅 조정이 필요 없음을 입증함. 유효한 아키텍처-양자화 조합에 대해 슈퍼넷의 가중치를 직접 유산받기 때문.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.