[논문 리뷰] Q-HyViT: Post-Training Quantization of Hybrid Vision Transformers with Bridge Block Reconstruction for IoT Systems
이 논문은 모바일비티브1/2, 이디언트포머 등 효율적인 하이브리드 비전 트랜스포머(예: MobileViTv1/2, EfficientFormer)를 위한 최초의 포스트트레이닝 양자화 방법인 Q-HyViT을 제안한다. 동적 활성화 범위, 브릿지 블록 내 제로포인트 오버플로우, 다양한 정규화 기법, 그리고 소형 모델 크기(<5M 파라미터)와 같은 네 가지 핵심 과제를 해결한다. 새로운 하이브리드 복원 오차 최소화 기법을 도입하여 스케일링 인자, 양자화 분해능(채널별/레이어별), 및 양자화 방식(대칭/비대칭)을 동시에 최적화함으로써, 기존 PTQ 방법 대비 평균 정확도 향상을 8.32% (8비트) 및 26.02% (6비트) 달성한다.
Recently, vision transformers (ViTs) have superseded convolutional neural networks in numerous applications, including classification, detection, and segmentation. However, the high computational requirements of ViTs hinder their widespread implementation. To address this issue, researchers have proposed efficient hybrid transformer architectures that combine convolutional and transformer layers with optimized attention computation of linear complexity. Additionally, post-training quantization has been proposed as a means of mitigating computational demands. For mobile devices, achieving optimal acceleration for ViTs necessitates the strategic integration of quantization techniques and efficient hybrid transformer structures. However, no prior investigation has applied quantization to efficient hybrid transformers. In this paper, we discover that applying existing post-training quantization (PTQ) methods for ViTs to efficient hybrid transformers leads to a drastic accuracy drop, attributed to the four following challenges: (i) highly dynamic ranges, (ii) zero-point overflow, (iii) diverse normalization, and (iv) limited model parameters ($<$5M). To overcome these challenges, we propose a new post-training quantization method, which is the first to quantize efficient hybrid ViTs (MobileViTv1, MobileViTv2, Mobile-Former, EfficientFormerV1, EfficientFormerV2). We achieve a significant improvement of 17.73% for 8-bit and 29.75% for 6-bit on average, respectively, compared with existing PTQ methods (EasyQuant, FQ-ViT, PTQ4ViT, and RepQ-ViT)}. We plan to release our code at https://gitlab.com/ones-ai/q-hyvit.
연구 동기 및 목표
- 순수한 ViT에서 성공한 바에 비해, 효율적인 하이브리드 비전 트랜스포머(HyViTs)에 대해 효과적인 포스트트레이닝 양자화(PTQ) 방법의 부재를 해결하기 위해.
- 하이브리드 비전 트랜스포머(HyViTs)의 양자화 과정에서 발생하는 네 가지 핵심 과제를 특정하고 해결하기 위해: 매우 동적인 활성화 범위, 브릿지 블록 내 제로포인트 오버플로우, 다양한 정규화 기법, 제한된 모델 파라미터 수(<5M).
- 브릿지 블록 및 비브릿지 블록 레이어 모두에 대해 양자화 파라미터(스케일링 인자, 분해능, 방식)를 동시에 최적화하는 통합형 엔드 투 엔드 PTQ 프레임워크를 개발하기 위해.
- 재학습 없이도 소형 HyViT 모델(예: MobileViTv1-xxs)의 고정밀도 양자화를 달성하여 자원 제약이 있는 IoT 기기에서의 효율적 배포를 가능하게 하기 위해.
제안 방법
- 브릿지 블록과 비브릿지 레이어에 대해 다르게 적용 가능한 하이브리드 복원 오차 최소화 기법을 제안하여, 양자화 파라미터의 동시 최적화를 가능하게 한다.
- 두 번째 차수 복원 오차 최소화를 확장하여 브릿지 블록을 포함함으로써 스케일링 인자 및 제로포인트의 정밀한 캘리브레이션을 가능하게 한다.
- 이중 최적화 전략을 도입: 비브릿지 레이어에는 채널별 양자화, 브릿지 블록에는 레이어별 양자화를 적용하여 제로포인트 오버플로우를 완화한다.
- 활성화 통계에 기반해 각 레이어마다 동적으로 양자화 분해능 및 방식(대칭/비대칭)을 선택하는 통합 프레임워크를 구현한다.
- 재학습 없이도 최적의 양자화 파라미터를 계산하기 위해 소규모 비라벨 캘리브레이션 데이터셋을 사용함으로써, 실세계 IoT 배포에 높은 적용성을 확보한다.
- 기존의 두 번째 차수 복원 오차 최소화 기법을 재사용하고 확장하여 하이브리드 아키텍처의 고유한 활성화 분포, 특히 브릿지 블록 내에서의 특성을 효과적으로 처리한다.

실험 결과
연구 질문
- RQ1순수한 ViT에서는 성공한 기존 포스트트레이닝 양자화 방법이, 복합적인 컨볼루션과 트랜스포머 레이어를 조합한 효율적 하이브리드 비전 트랜스포머에 적용되었을 때 실패하는 이유는 무엇인가?
- RQ2소형 HyViT 모델에서 브릿지 블록 내 제로포인트 오버플로우가 정확도 저하에 기여하는 방식은 무엇이며, 이를 완화할 수 있는 양자화 전략은 무엇인가?
- RQ3하이브리드 비전 트랜스포머에서 복원 오차를 최소화하기 위해, 양자화 분해능(채널별 대비 레이어별)과 양자화 방식(대칭 대비 비대칭) 사이의 최적의 트레이드오프는 무엇인가?
- RQ4하이브리드 ViT에서 다양하게 적용되는 정규화 기법이 포스트트레이닝 양자화의 강건성에 미치는 영향은 무엇이며, 양자화 과정에서 이를 어떻게 조율할 수 있는가?
- RQ5통합형 PTQ 프레임워크는 재학습 없이도 소형 HyViT 모델(<5M 파라미터)에서 상당한 정확도 향상을 달성할 수 있는가? 기존 최고 수준의 PTQ 방법과 비교했을 때의 성능은 어떠한가?
주요 결과
- Q-HyViT는 다양한 하이브리드 ViT 모델에서 8비트 정밀도로 양자화할 경우, 기존 PTQ 방법(EasyQuant, FQ-ViT, PTQ4ViT) 대비 평균 정확도 향상을 8.32% 달성한다.
- 6비트 양자화에서는 Q-HyViT가 놀라운 26.02% 평균 정확도 향상을 보이며, 저정밀도 환경에서의 효과성을 입증한다.
- 채널별 양자화에서 레이어별 양자화로 전환함으로써 브릿지 블록 내 제로포인트 오버플로우를 성공적으로 완화하였으며, 이는 음수 제로포인트 값의 클램핑을 방지한다.
- 히스토그램 분석 결과, 브릿지 블록에서 레이어별 양자화가 채널별 양자화보다 실제 활성화와 양자화된 활성화 간의 겹침이 훨씬 더 우수함을 확인하였다.
- 실험 결과, 캘리브레이션 데이터 크기를 32장에서 128장으로 늘여도 정확도에 미치는 영향이 미미함을 확인하여, Q-HyViT가 소규모 캘리브레이션 세트에 대해 매우 강건함을 입증하였다.
- 제로포인트 오버플로우로 인한 정확도 저하는 소형 모델(예: MobileViTv1-xxs)에서 가장 심각한 편이지만, 브릿지 블록 내 레이어별 양자화로 효과적으로 감소되며, 8비트 정밀도에서도 최소한의 성능 저하만을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.