Skip to main content
QUICK REVIEW

[논문 리뷰] CP-ViT: Cascade Vision Transformer Pruning via Progressive Sparsity Prediction

Zhuoran Song, Yihong Xu|arXiv (Cornell University)|2022. 03. 09.
CCD and CMOS Imaging Sensors인용 수 20
한 줄 요약

CP-ViT는 비전 트랜스포머를 위한 캐스케이드 가지치기를 도입하여 누적 점수와 계층 인식 가지치기를 활용해 비정보적 패치와 헤드를 점진적으로 예측하고 가지치며, 파인튜닝 여부에 관계없이 정확도 손실을 최소화하면서 FLOPs를 감소시킨다.

ABSTRACT

Vision transformer (ViT) has achieved competitive accuracy on a variety of computer vision applications, but its computational cost impedes the deployment on resource-limited mobile devices. We explore the sparsity in ViT and observe that informative patches and heads are sufficient for accurate image recognition. In this paper, we propose a cascade pruning framework named CP-ViT by predicting sparsity in ViT models progressively and dynamically to reduce computational redundancy while minimizing the accuracy loss. Specifically, we define the cumulative score to reserve the informative patches and heads across the ViT model for better accuracy. We also propose the dynamic pruning ratio adjustment technique based on layer-aware attention range. CP-ViT has great general applicability for practical deployment, which can be applied to a wide range of ViT models and can achieve superior accuracy with or without fine-tuning. Extensive experiments on ImageNet, CIFAR-10, and CIFAR-100 with various pre-trained models have demonstrated the effectiveness and efficiency of CP-ViT. By progressively pruning 50\% patches, our CP-ViT method reduces over 40\% FLOPs while maintaining accuracy loss within 1\%.

연구 동기 및 목표

  • 비전 트랜스포머(ViT)의 희소성을 탐구하여 정확도를 좌우하는 정보가 풍부한 패치와 헤드(PH-영역)를 식별한다.
  • 정보가 풍부하지 않은 PH-영역을 최소한의 정확도 손실로 동적으로 가지치기하기 위한 cascade 가지치기 프레임워크를 개발한다.
  • 층 간 정보를 보존하기 위해 누적 점수 메커니즘을 도입한다.
  • 효율성과 정확도 간의 균형을 맞추기 위해 attention 범위를 기반으로 한 계층 인식 가지치기 비율 조정 방법을 제안한다.
  • 다양한 ViT 모델에 걸쳐 폭넓은 적용 가능성을 보이고, 파인튜닝 여부에 관계없이 성능을 보여준다.

제안 방법

  • ViT에서 패치/헤드의 정보성(informativeness)을 attention 확률로 파생된 정보성으로 정의한다.
  • 계층 간 누적 점수를 계산하는 점진적 희소성 예측 프레임워크를 사용한다.
  • MHSA와 FFN에서 정보성이 낮은 PH-영역을 마스킹하여 cascade 가지치기를 적용하고, 이후 계층에서의 계산 건너뛰기를 가능하게 한다.
  • Attention 범위를 활용한 계층 인식 가지치기 비율 방법(Layer-Aware Pruning Ratio)으로 계층별 가지치기를 조정한다.
  • 정보성이 높은 최대 attention 확률 값을 기반으로 가지치기를 수행하여 정보성 근사치를 효율적으로 확보한다.
  • 가지치기 하에서 정확도를 높이기 위해 사전 학습된 모델에 대해 선택적으로 파인튜닝을 수행한다.

실험 결과

연구 질문

  • RQ1ViT 모델이 정확도에 크게 영향을 주는 정보-rich한 패치와 헤드의 희소성을 보일 수 있는가?
  • RQ2:

주요 결과

  • CP-ViT는 약 50%의 패치를 가지치하고 약 40% 이상의 FLOPs를 절감하면서도 파인튜닝 없이도 정확도 손실을 1% 미만으로 유지할 수 있다.
  • 계층별로 attention range에 맞춰 가지치기 비율을 조정하면 더 큰 가지치기에서도 견고성이 향상되고 정확도 손실이 감소한다.
  • 누적 점수를 이용한 점진적 희소성 예측은 계층 간 정보성이 풍부한 PH-영역을 유지시키며, 무작위 가지치기와 층별 무지(prior) 가지치기보다 우수하다.
  • CP-ViT는 다른 ViT 가지치기 방법과 비교해 파인튜닝 여부에 관계없이 우수한 정확도- FLOPs 트레이드오프를 제공한다.
  • CP-ViT를 파인튜닝하면 여러 ViT 모델에서 달성 가능한 FLOPs 절감이 크게 증가하면서 정확도도 유지되거나 소폭 개선된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.