[논문 리뷰] HAWQ: Hessian AWare Quantization of Neural Networks with Mixed-Precision
HAWQ는 Hessian 기반의 2차 정보를 활용해 계층별 혼합 정밀도를 자동으로 할당하고 결정론적 파인 튜닝 순서를 제공합니다. CIFAR-10 및 ImageNet 모델에서 비슷하거나 더 나은 정확도로 더 높은 압축을 달성합니다.
Model size and inference speed/power have become a major challenge in the deployment of Neural Networks for many applications. A promising approach to address these problems is quantization. However, uniformly quantizing a model to ultra low precision leads to significant accuracy degradation. A novel solution for this is to use mixed-precision quantization, as some parts of the network may allow lower precision as compared to other layers. However, there is no systematic way to determine the precision of different layers. A brute force approach is not feasible for deep networks, as the search space for mixed-precision is exponential in the number of layers. Another challenge is a similar factorial complexity for determining block-wise fine-tuning order when quantizing the model to a target precision. Here, we introduce Hessian AWare Quantization (HAWQ), a novel second-order quantization method to address these problems. HAWQ allows for the automatic selection of the relative quantization precision of each layer, based on the layer's Hessian spectrum. Moreover, HAWQ provides a deterministic fine-tuning order for quantizing layers, based on second-order information. We show the results of our method on Cifar-10 using ResNet20, and on ImageNet using Inception-V3, ResNet50 and SqueezeNext models. Comparing HAWQ with state-of-the-art shows that we can achieve similar/better accuracy with $8 imes$ activation compression ratio on ResNet20, as compared to DNAS~\cite{wu2018mixed}, and up to $1\%$ higher accuracy with up to $14\%$ smaller models on ResNet50 and Inception-V3, compared to recently proposed methods of RVQuant~\cite{park2018value} and HAQ~\cite{wang2018haq}. Furthermore, we show that we can quantize SqueezeNext to just 1MB model size while achieving above $68\%$ top1 accuracy on ImageNet.
연구 동기 및 목표
- 모든 계층에 대해 균일한 정밀도 없이 양자화를 통해 모델 크기와 추론 에너지를 감소시키는 동기를 제시합니다.
- 계층별 양자화 정밀도를 자동으로 결정하는 Hessian 기반 방법을 제안합니다.
- 양자화된 모델에 대한 결정론적이고 2차 정보에 기반한 파인 튜닝 순서를 제공합니다.
- CIFAR-10 및 ImageNet에서 최첨단 또는 경쟁력 있는 정확도를 높은 압축으로 달성합니다.
제안 방법
- 네트워크를 블록으로 분할하고 각 블록에 대해 매트릭스 프리 파워 이터레이션(Hessian matvec)을 통해 해시안 고유값을 계산합니다.
- 블록별 민감도 지표 S_i = lambda_i / n_i 를 정의하여 정밀도 선택을 순위화합니다(λ_i는 상위 해시안 고유값, n_i는 블록 크기).
- 내림차순으로 S_i에 따라 블록의 상대 비트 정밀도를 할당하여 혼합 정밀도 양자화를 유도합니다.
- Q(W_i)와 W_i 사이의 차이 제곱의 노름에 λ_i를 곱한 Omega_i = λ_i * ||Q(W_i) - W_i||^2 를 사용해 자주 곱 구간의 블록에 더 높은 곡률과 큰 변화를 가진 블록의 파인 튜닝 순서를 정의합니다.
- 상위 고유값으로 스케일링된 블록 대각 행렬로 해시안을 근사화하여 복잡성을 줄입니다.
- 도출된 순서로 블록 단위의 해시안 정보를 활용한 양자화 및 이후 블록 단위의 파인 튜닝을 수행합니다.
- 정렬 및 해시안 가이던스의 영향력을 보여주는 제거 실험(ablation)을 제공합니다.
실험 결과
연구 질문
- RQ1해시안 스펙트럼 정보가 혼합 정밀도 양자화에서 상대적 계층/블록 양자화 정밀도 선택을 안내할 수 있는가?
- RQ2해시안 가이던 순서의 블록 단위 양자화와 이후 파인 튜닝이 최첨단 방법들과 비교해 더 높은 압축과 비슷한 정확도를 달성할 수 있는가?
- RQ3해시안 기반 순서가 대규모 비전 모델의 수렴 속도 및 최종 정확도에 미치는 영향은 무엇인가?
- RQ4HAWQ가 CIFAR-10의 ResNet20 및 ImageNet의 Inception-V3, ResNet-50, SqueezeNext에서 기존 양자화 방법과 비교해 어떤 성능을 보이는가?
주요 결과
- HAWQ는 CIFAR-10 ResNet20에서 활성화 압축을 최대 8x까지 달성하는 등 유사하거나 더 나은 정확도를 유지하며 상당한 압축을 달성합니다.
- ImageNet에서 Inception-V3의 경우 Top-1 약 75.52% 수준에서 가중치+활성화 압축 최대 12.04x를 달성하고 Direct 대비 및 여러 대안보다 정확도와 모델 크기 측면에서 우수합니다.
- ImageNet의 ResNet-50에서 HAWQ는 7.96 MB 모델 크기에서 75.48% Top-1을 달성하며 정확도와 크기 면에서 HAQ를 상회합니다.
- ImageNet의 SqueezeNext에서 HAWQ는 1 MB로 축소되며 68.02% Top-1 정확도를 달성하여 Direct 양자화를 크게 능가하고 초소형 배치를 가능하게 합니다.
- 절단은 해시안 기반 순서가 양자화와 파인 튜닝 모두에서 수렴 속도와 최종 정확도를 실질적으로 개선함을 보여주며, 역순 기준선과 비교해 현저한 차이를 보입니다.
- 이 방법은 두 번째 차원 정보가 다양한 구조에서 혼합 정밀도 양자화를 수행하는 원리적이고 확장 가능한 방법임을 입증합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.