[논문 리뷰] Make RepVGG Greater Again: A Quantization-aware Approach
이 논문은 정량화 인식 재구성 합성곱 블록인 QARepVGG를 제안한다. 이는 RepVGG의 높은 FP32 정확도와 추론 속도를 유지하면서 INT8 정량화 정확도 저하를 극적으로 줄인다. 표준 후처리 정량화를 통해 ImageNet에서 2% 미만의 상위-1 정확도 손실을 달성한다. 방법은 블록의 가중치 및 활성화 분포를 정량화에 유리하도록 재구성하여, 추가 학습이나 하드웨어 비용 없이도 강건한 배포를 가능하게 한다.
The tradeoff between performance and inference speed is critical for practical applications. Architecture reparameterization obtains better tradeoffs and it is becoming an increasingly popular ingredient in modern convolutional neural networks. Nonetheless, its quantization performance is usually too poor to deploy (more than 20% top-1 accuracy drop on ImageNet) when INT8 inference is desired. In this paper, we dive into the underlying mechanism of this failure, where the original design inevitably enlarges quantization error. We propose a simple, robust, and effective remedy to have a quantization-friendly structure that also enjoys reparameterization benefits. Our method greatly bridges the gap between INT8 and FP32 accuracy for RepVGG. Without bells and whistles, the top-1 accuracy drop on ImageNet is reduced within 2% by standard post-training quantization. Moreover, our method also achieves similar FP32 performance as RepVGG. Extensive experiments on detection and semantic segmentation tasks verify its generalization.
연구 동기 및 목표
- RepVGG에서 INT8 후처리 정량화 하에 20% 이상의 상위-1 정확도 손실을 겪는 근본 원인을 규명하는 것.
- RepVGG의 높은 FP32 성능과 추론 속도를 유지하면서도 본질적으로 정량화에 강건한 재구성 블록을 설계하는 것.
- 정량화 인식 학습이나 아키텍처 전반적 개편 없이도 재구성 네트워크의 최신 후처리 정량화 성능을 달성하는 방법을 개발하는 것.
- 다양한 비전 작업, 특히 객체 검출 및 세그멘테이션에서 PTQ 및 QAT 설정 모두에 걸쳐 일반화 성능을 검증하는 것.
제안 방법
- 저자들은 RepVGG의 다중 브랜치 아키텍처가 불리한 가중치 및 활성화 분포로 인해 정량화 오차를 본질적으로 증대시킨다는 것을 규명한다.
- 가중치 및 활성화 분포를 더 정량화 우호적으로 만들기 위해 잔차 연결과 배치 정규화의 위치를 재설계한 QARepVGG를 제안한다.
- 모든 브랜치를 단일 3×3 합성곱으로 융합함으로써 추론 속도를 RepVGG와 동일하게 유지하며 재구성 이점을 그대로 보존한다.
- 다음 네 가지 핵심 구성 요소를 포함한다: (1) 메인 브랜치에서 배치 정규화 제거, (2) 깊이 분해 합성곱 뒤에 잔차 연결을 스킵 연결로 대체, (3) 정규화와 활성화의 순서 재정렬, (4) 단일 정규화 레이어 사용.
- 표준 후처리 정량화(PTQ) 및 정량화 인식 학습(QAT) 모두와 호환되며, 추가 校정 또는 보정이 필요 없다.
- 최종 아키텍처는 각 구성 요소의 정량화 강건성 기여도를 검증하기 위한 분석 실험을 통해 유도된다.
실험 결과
연구 질문
- RQ1왜 RepVGG는 특히 후처리 정량화 하에서 심각한 정량화 정확도 저하를 겪는가?
- RQ2RepVGG 아키텍처의 어떤 구조적 특성이 정량화 오차를 증가시키는가?
- RQ3고 FP32 정확도와 추론 속도를 유지하면서도 본질적으로 INT8 정량화에 강건한 재구성 블록을 설계할 수 있는가?
- RQ4가중치 및 활성화 분포의 변화가 재구성 네트워크의 정량화 성능에 어떤 영향을 미치는가?
- RQ5제안된 QARepVGG 설계는 객체 검출 및 세그멘테이션과 같은 다양한 모델 스케일과 비전 작업에 일반화되는가?
주요 결과
- QARepVGG는 후처리 정량화 하에서 ImageNet에서 상위-1 정확도 70.4%를 달성했으며, RepVGG-A0의 50.3%에 비해 정확도 손실을 2% 미만으로 줄였다.
- RepVGG-B1g2 변형에서 QARepVGG는 77.0%의 INT8 정확도를 유지했고, RepVGG의 14.5%에 비해 62.5%포인트 향상되었다.
- 정량화 인식 학습 하에서 QARepVGG는 ImageNet에서 상위-1 정확도 71.9%를 달성했으며, RepVGG+QAT를 5.6%포인트 초월했다.
- COCO에서 객체 검출 시 QARepVGG 기반 YOLOv6 모델은 PTQ 하에서 mAP 손실이 1.3%에 그쳤고, RepVGG 기반 YOLOv6s는 7.4%의 손실을 보였다.
- FCN 및 DeepLabV3+에서 세그멘테이션 작업에서 QARepVGG는 mIoU 손실을 RepVGG의 5.3%에서 QARepVGG의 1.2%로 줄여 강력한 일반화 성능을 입증했다.
- QARepVGG는 RepVGG와 동일한 FP32 정확도를 확보하면서도 동일한 추론 속도를 유지하여 정량화 배포에 즉시 대체 가능한 솔루션을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.