Skip to main content
QUICK REVIEW

[논문 리뷰] LRP-QViT: Mixed-Precision Vision Transformer Quantization via Layer-wise Relevance Propagation

Navin Ranjan, Andreas Savakis|arXiv (Cornell University)|2024. 01. 20.
Visual Attention and Saliency Detection인용 수 4
한 줄 요약

LRP-QViT는 레이어별 중요도를 기반으로 비트 할당을 결정하는 레이어와 레이어별 중요도를 고려한 혼합 정밀도 후기학습 양자화 방법을 제안한다. 이는 고정 비트 및 이전의 혼합 정밀도 방법보다 정확도를 향상시킨다. 또한 후 LayerNorm 활성화에 대해 클리핑된 채널별 양자화를 도입하여 채널 간 변동성을 줄이고, ViT, DeiT, Swin 모델에서 4비트 및 6비트 양자화 수준에서 최고 성능을 달성한다.

ABSTRACT

Vision transformers (ViTs) have demonstrated remarkable performance across various visual tasks. However, ViT models suffer from substantial computational and memory requirements, making it challenging to deploy them on resource-constrained platforms. Quantization is a popular approach for reducing model size, but most studies mainly focus on equal bit-width quantization for the entire network, resulting in sub-optimal solutions. While there are few works on mixed precision quantization (MPQ) for ViTs, they typically rely on search space-based methods or employ mixed precision arbitrarily. In this paper, we introduce LRP-QViT, an explainability-based method for assigning mixed-precision bit allocations to different layers based on their importance during classification. Specifically, to measure the contribution score of each layer in predicting the target class, we employ the Layer-wise Relevance Propagation (LRP) method. LRP assigns local relevance at the output layer and propagates it through all layers, distributing the relevance until it reaches the input layers. These relevance scores serve as indicators for computing the layer contribution score. Additionally, we have introduced a clipped channel-wise quantization aimed at eliminating outliers from post-LayerNorm activations to alleviate severe inter-channel variations. To validate and assess our approach, we employ LRP-QViT across ViT, DeiT, and Swin transformer models on various datasets. Our experimental findings demonstrate that both our fixed-bit and mixed-bit post-training quantization methods surpass existing models in the context of 4-bit and 6-bit quantization.

연구 동기 및 목표

  • 비트 폭이 동일한 양자화 방법이 비현실적인 성능을 보이는 비전 트랜스포머 문제를 해결하기 위해, 레이어 중요도 기반 혼합 정밀도 양자화를 가능하게 한다.
  • 레이어 간 변동성으로 인한 후 LayerNorm 활성화의 성능 저하를 새로운 클리핑 메커니즘으로 감소시킨다.
  • 재학습 없이도 높은 정확도를 유지하면서 효율적인 후기학습 양자화 프레임워크를 개발한다.
  • 이미지 분류, 검출, 세그멘테이션 벤치마크에서 기존의 고정 비트 및 혼합 정밀도 양자화 방법보다 뛰어난 성능을 입증한다.

제안 방법

  • LRP를 사용하여 출력에서 각 레이어로 역전파하는 관련성을 기반으로 레이어 기여도 점수를 계산함으로써 분류에 있어 각 레이어의 중요도를 정량화한다.
  • LRP를 통해 유도된 중요도 점수에 따라 각 레이어의 비트 할당을 결정하며, 더 중요한 레이어에는 더 높은 정밀도를 할당한다.
  • 후 LayerNorm 활성화에 대해 클리핑된 채널별 양자화를 적용하며, LayerNorm의 애핀 팩터와 이후 레이어의 가중치 조정을 통해 외곽치를 제거한다.
  • 프레임워크는 RepQ-ViT의 개선 사항을 통합하며, 후 소프트맥스에 대한 $\log\sqrt{2}$ 양자화기와 추론용 $\log 2$ 스케일링을 포함한다.
  • 프레임워크는 후기학습 양자화(PTQ) 기반으로 운영되며, 소규모 校정 세트(32장의 이미지)만 필요하고, 미세조정이 불필요하다.
  • LRP로 식별된 덜 중요한 레이어에서 비트 수를 줄임으로써 혼합 정밀도 비트 할당을 최적화하며, 평균 비트 폭 제약 조건을 유지한다.

실험 결과

연구 질문

  • RQ1LRP를 통해 유도된 레이어 중요도 점수는 비전 트랜스포머에서 혼합 정밀도 비트 할당을 효과적으로 이끌 수 있는가?
  • RQ2후 LayerNorm 활성화에 대해 클리핑된 채널별 양자화는 채널 간 변동성으로 인한 성능 저하를 완화하는가?
  • RQ3낮은 비트 폭에서 LRP-QViT는 고정 비트 및 기존 혼합 정밀도 양자화 방법과 비교해 정확도 및 효율성 면에서 어떻게 다른가?
  • RQ4제안된 방법은 ViT, DeiT, Swin 등 다양한 비전 트랜스포머 아키텍처와 분류, 검출, 세그멘테이션 등의 작업에서 높은 성능을 유지할 수 있는가?
  • RQ5제안된 PTQ 프레임워크에서 校정 데이터 크기, 추론 시간, 정확도 사이의 상호 교환 관계는 어떠한가?

주요 결과

  • Swin-S 모델을 사용해 32비트 캘리브레이션 및 32장의 샘플로 ImageNet-1K에서 81.37%의 top-1 정확도를 달성했으며, 동일 비트 폭에서 RepQ-ViT(80.55%) 및 CRL-QViT(80.55%)를 모두 초월한다.
  • DeiT-S에 4비트 양자화를 적용한 경우, 첫 두 블록에 5비트 정밀도를 할당하고 나머지 레이어에 4비트를 할당했을 때 75.66%의 정확도를 기록했으며, 균일한 4비트 양자화(70.78%)보다 향상되었다.
  • 클리핑된 채널별 양자화 방법은 표준 채널별 양자화 대비 0.5% 향상되었고, 레이어별 양자화 대비 1.7% 향상되었다.
  • LRP-QViT는 ViT, DeiT, Swin 모델에서 분류, 검출, 세그멘테이션 작업 전반에 걸쳐 4비트 및 6비트 후기학습 양자화에서 최고 성능을 기록하며, 기존 방법을 모두 능가한다.
  • 이 방법은 단지 32장의 캘리브레이션 이미지만 필요하며, FQViT(재구성 불필요)와 유사한 캘리브레이션 시간을 기록하지만, 정확도에서 크게 뛰어나 4비트 양자화에서 0.10% 대비 1.1% 향상되었다.
  • 제거 분석 결과, ViT 기반 모델의 첫 두 블록이 가장 중요하며, LRP 기반 프루닝을 통해 덜 중요한 레이어의 비트 수를 줄임으로써 모델 크기를 유지하면서 성능을 향상시킬 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.