[논문 리뷰] Patch Slimming for Efficient Vision Transformers
이 논문은 최종 분류 특징에 대한 영향을 기반으로 부용한 패치를 제거함으로써 ViT의 FLOPs를 감소시키는 상향식 프루닝 방법인 Patch Slimming을 제안한다. 각 패치의 기여도를 추정하고 가장 영향력 있는 패치들만 유지함으로써 ViT-Tiny에서 FLOPs를 45% 이상 감소시키며 ImageNet에서 정확도 손실은 0.2%에 불과하다.
This paper studies the efficiency problem for visual transformers by excavating redundant calculation in given networks. The recent transformer architecture has demonstrated its effectiveness for achieving excellent performance on a series of computer vision tasks. However, similar to that of convolutional neural networks, the huge computational cost of vision transformers is still a severe issue. Considering that the attention mechanism aggregates different patches layer-by-layer, we present a novel patch slimming approach that discards useless patches in a top-down paradigm. We first identify the effective patches in the last layer and then use them to guide the patch selection process of previous layers. For each layer, the impact of a patch on the final output feature is approximated and patches with less impact will be removed. Experimental results on benchmark datasets demonstrate that the proposed method can significantly reduce the computational costs of vision transformers without affecting their performances. For example, over 45% FLOPs of the ViT-Ti model can be reduced with only 0.2% top-1 accuracy drop on the ImageNet dataset.
연구 동기 및 목표
- 자원 제약이 있는 장치에의 배포를 제한하는 Vision Transformers의 높은 계산 비용을 해결한다.
- CNN의 채널 프루닝과는 달리, 계층 간에 부용한 패치를 식별하고 제거한다.
- 모델 성능을 유지하면서 추론 속도를 향상시키는 체계적인 프루닝 전략을 개발한다.
- 원칙적이고 오차 제어 가능한 패치 제거 과정을 통해 Vision Transformers의 효율적 배포를 가능하게 한다.
- 더 깊은 계층에서 얕은 계층보다 훨씬 더 많은 패치 수준의 부용성이 존재함을 입증한다.
제안 방법
- 최종 계층에서 시작하여 네트워크를 거꾸로 거슬러 올라가는 상향식 프루닝 프레임워크를 제안한다.
- 에러 역전파를 사용하여 각 패치가 최종 출력 특징(클래스 토큰)에 미치는 영향을 측정함으로써 패치의 중요도를 추정한다.
- FLOPs 감소와 정확도 손실 간의 트레이드오프를 제어하기 위해 전역적인 내성 오차 임계값 ε를 사용한다.
- 더 깊은 계층에서 어떤 공간적 대응 패치라도 유지되어 있다면 해당 패치도 유지함으로써 정보 흐름을 유지한다.
- 기울기 기반의 미분 가능 점수를 사용하여 각 패치가 최종 예측에 기여하는 정도를 순위화한다.
- 완전한 미세조정 없이도 각 패치의 중요도를 추정하기 위해 복구 오차 근사를 사용한다.
실험 결과
연구 질문
- RQ1Vision Transformers에서 패치 수준의 부용성을 성능 저하 없이 효과적으로 식별하고 제거할 수 있는가?
- RQ2Vision Transformers의 다양한 계층에서 패치의 부용성은 어떻게 달라지는가?
- RQ3균일하거나 무작위 프루닝과 비교해 상향식 프루닝 전략이 모델 성능을 유지하면서 FLOPs 감소를 더 효과적으로 달성할 수 있는가?
- RQ4패치 프루닝 시 FLOPs 감소와 정확도 손실 간의 최적의 트레이드오프는 무엇인가?
- RQ5제안된 영향도 추정 방법은 주어진 프루닝 비율에서 주의 기반 또는 무작위 프루닝과 비교해 모델 유용성을 얼마나 잘 유지하는가?
주요 결과
- 제안된 Patch Slimming 방법은 ViT-Tiny 모델에서 FLOPs를 45.2% 감소시키며 ImageNet에서 상위-1 정확도 손실은 0.2%에 그친다.
- DeiT-S는 FLOPs를 45.8% 감소시키며 정확도 손실은 0.2%로, 균일 프루닝(상위-1 정확도 77.2%, -2.6% 손실)을 초월한다.
- 더 깊은 계층은 얕은 계층보다 훨씬 더 높은 패치 부용성을 보이며, 이는 상향식 프루닝 전략의 타당성을 뒷받침한다.
- 같은 프루닝 비율에서 제안된 영향도 추정 방법은 랜덤 또는 주의 기반 프루닝 기준보다 더 낮은 정확도 손실을 기록한다.
- 프루닝된 모델은 더 많은 패치가 얕은 계층에 유지되고 더 많은 패치가 깊은 계층에서 제거되는 피라미드형 아키텍처를 형성한다.
- 높은 프루닝 비율에서도 높은 성능을 유지하며, FLOPs 감소율이 45% 이하일 경우 정확도 손실이 0.4% 미만으로 유지된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.