[논문 리뷰] FracBits: Mixed Precision Quantization via Fractional Bit-Widths
FracBits는 정수 비트 폭 사이의 연속적인 분수 값으로 비트 폭을 다루는, 한 번의 학습으로 끝나는 미분 가능 혼합 정밀도 양자화 방법을 제안한다. 이는 층별 및 커널별 정밀도의 엔드 투 엔드 최적화를 가능하게 하며, 인접한 비트 폭에서 양자화된 가중치를 보간하고, 미분 가능한 정규화 항을 사용함으로써 ImageNet에서 모델 크기 및 계산 자원 제약 조건이 엄격한 상황에서도 최신 기술 수준의 정확도를 달성한다.
Model quantization helps to reduce model size and latency of deep neural networks. Mixed precision quantization is favorable with customized hardwares supporting arithmetic operations at multiple bit-widths to achieve maximum efficiency. We propose a novel learning-based algorithm to derive mixed precision models end-to-end under target computation constraints and model sizes. During the optimization, the bit-width of each layer / kernel in the model is at a fractional status of two consecutive bit-widths which can be adjusted gradually. With a differentiable regularization term, the resource constraints can be met during the quantization-aware training which results in an optimized mixed precision model. Further, our method can be naturally combined with channel pruning for better computation cost allocation. Our final models achieve comparable or better performance than previous quantization methods with mixed precision on MobilenetV1/V2, ResNet18 under different resource constraints on ImageNet dataset.
연구 동기 및 목표
- 강화 학습 기반 혼합 정밀도 양자화 방법의 비효율성과 높은 탐색 비용을 해결한다.
- 양자화된 신경망에서 층 또는 커널별 비트 폭 할당에 대해 엔드 투 엔드로 미분 가능한 최적화를 가능하게 한다.
- 분수 비트 폭를 允허함으로써 모델 크기 및 계산 비용 제약 조건이 엄격한 상황에서도 정확도를 향상시킨다.
- 통합적이고 미분 가능한 프레임워크에서 층별 및 커널별 혼합 정밀도 양자화를 모두 지원한다.
- 다양한 모델 버전을 위한 비용이 많이 드는 탐색이나 학습이 필요 없이 연속적인 비트 폭 파라미터를 사용한 한 번의 학습을 가능하게 한다.
제안 방법
- 각 층 또는 커널에 대해 두 인접한 정수 비트 폭 사이의 연속적이고 학습 가능한 파라미터로 비트 폭를 설정한다 (예: 3.2비트).
- 두 인접한 비트 폭에서의 양자화 출력을 가중 평균으로 사용하는 미분 가능한 보간 함수를 통해 양자화된 활성화 및 가중치를 계산한다.
- 학습 중에 목표 제약 조건(모델 크기 또는 FLOPs)을 만족시키기 위해 자원 사용을 페널티 처리하는 미분 가능한 정규화 항을 도입한다.
- 연속적인 비트 폭 파라미터를 사용해 전체 네트워크를 엔드 투 엔드로 학습함으로써 정밀도 할당에 대한 기울기 기반 최적화를 가능하게 한다.
- 양자화 연산을 통해 기울기를 전파하기 위해 직선 추정법(Stealth-Through Estimation, STE)을 적용하여 미분 가능성을 유지한다.
- 각 컨볼루션 커널 또는 채널 그룹에 대해 독립적인 분수 비트 폭를 할당함으로써 채널별 및 커널별 정밀도 할당을 지원한다.
실험 결과
연구 질문
- RQ1연속적인 비트 폭에 대해 혼합 정밀도 양자화를 미분 가능한 최적화 문제로 공식화할 수 있는가?
- RQ2한 번의 학습 절차가 강화 학습 기반 또는 반복적 탐색 기반 혼합 정밀도 방법보다 정확도와 효율성 면에서 뛰어나게 할 수 있는가?
- RQ3분수 비트 폭를 允허함으로써 균일하거나 이산적인 혼합 정밀도 대비 모델 크기 및 계산 자원 제약 조건이 엄격한 상황에서 정확도 향상이 이루어지는가?
- RQ4저비트 양자화에서 커널별 정밀도 할당이 층별 할당보다 성능 향상에 더 큰 기여를 하는가?
- RQ5SAT 및 AutoQ와 같은 강력한 베이스라인과 비교해 본다면, 제안된 방법은 정확도와 자원 효율성 측면에서 어떻게 다른가?
주요 결과
- 2비트 MobileNet V1에서 FracBits-SAT는 균일 양자화 기반 베이스라인 SAT보다 상대적으로 3.0% 정확도 향상을 달성했으며, 2비트 MobileNet V2에서는 2.8% 향상되었다.
- 도전적인 3비트 설정에서 FracBits-SAT는 MobileNet V1에서 SAT보다 상위 1위 정확도로 0.6% 향상되었고, MobileNet V2에서는 0.8% 향상되었다.
- 커널별 양자화에서 FB-SAT-K는 3비트 및 4비트 MobileNet V2에서 각각 SAT보다 상위 1위 정확도로 1.0% 및 0.8% 향상되었다.
- FB-SAT-K는 층별 FracBits-SAT보다 3비트 및 4비트 MobileNet V2에서 각각 0.4% 및 0.3% 향상되어 커널별 정밀도 할당의 이점이 입증되었다.
- ResNet18에서 FB-SAT-K는 3비트 및 4비트 설정에서 각각 SAT보다 상위 1위 정확도로 0.5% 향상되었으며, 두 비트 폭 모두에서 일관된 향상이 관찰되었다.
- 이 방법은 모델 크기 및 계산 비용 제약 조건 하에서 최신 기술 수준의 성능을 달성하였으며, 평가된 모든 설정에서 HAQ, AutoQ 및 SAT를 모두 초월하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.