[논문 리뷰] MiniViT: Compressing Vision Transformers with Weight Multiplexing
MiniViT는 가중치 다중화—가중치 변환과 지식 정복을 조합한 기법을 사용하여 비전 트랜스포머의 압축 프레임워크를 제안한다. 이는 모델 크기를 줄이면서 정확도를 향상시킨다. Swin-B에서 파라미터를 48% 감소시키며 ImageNet에서 Top-1 정확도를 1.0% 향상시켰고, DeiT-B를 9.7배(86M에서 9M 파라미터로) 압축하면서 성능 저하를 최소화한다.
Vision Transformer (ViT) models have recently drawn much attention in computer vision due to their high model capability. However, ViT models suffer from huge number of parameters, restricting their applicability on devices with limited memory. To alleviate this problem, we propose MiniViT, a new compression framework, which achieves parameter reduction in vision transformers while retaining the same performance. The central idea of MiniViT is to multiplex the weights of consecutive transformer blocks. More specifically, we make the weights shared across layers, while imposing a transformation on the weights to increase diversity. Weight distillation over self-attention is also applied to transfer knowledge from large-scale ViT models to weight-multiplexed compact models. Comprehensive experiments demonstrate the efficacy of MiniViT, showing that it can reduce the size of the pre-trained Swin-B transformer by 48\%, while achieving an increase of 1.0\% in Top-1 accuracy on ImageNet. Moreover, using a single-layer of parameters, MiniViT is able to compress DeiT-B by 9.7 times from 86M to 9M parameters, without seriously compromising the performance. Finally, we verify the transferability of MiniViT by reporting its performance on downstream benchmarks. Code and models are available at here.
연구 동기 및 목표
- 자원 제약이 있는 장치에 배포하기 어려운 대규모 파라미터 수를 가진 비전 트랜스포머(ViTs)의 문제를 해결한다.
- ViTs에서 단순한 계층 간 가중치 공유로 인한 학습 불안정성과 성능 저하 문제를 해결한다.
- 동형 및 계층적 ViT 아키텍처 모두에 효과적인 일반적인 압축 프레임워크를 개발한다.
- 높은 압축 비율에서도 성능을 희생시키지 않고 파라미터 효율성을 향상시킨다.
- 압축된 모델이 객체 검출 및 세그멘테이션과 같은 후행 비전 작업으로의 이식성을 보장한다.
제안 방법
- 각 트랜스포머 블록 간에 가중치를 공유하면서도 계층별 선형 변환을 적용하여 가중치 다양성을 증가시키는 가중치 다중화 기법을 도입한다.
- 공유된 각 계층에서 멀티헤드 자기주의(MSA) 및 다층 퍼셉트론(MLP) 모듈에 대해 별도의 변환 행렬을 적용하여 동일한 가중치 갱신을 방지한다.
- 계층 간에 배치 정규화 파라미터를 분리하여 안정적인 특징 통계를 유지하고 학습 안정성을 향상시킨다.
- 예측 수준, 주의 수준, 히든 상태 수준의 다중 수준 지식 정복을 구현하여 대규모 교사 모델에서 소규모 학생 모델로 지식을 전달한다.
- 모든 공유 계층을 하나의 레이어 파라미터 세트로 표현하여 모델 크기를 극적으로 줄이면서도 성능을 유지한다.
- 후행 작업에서 성능을 추가로 향상시키기 위해 검출 정복을 사용해 압축된 모델을 미세조정한다.
실험 결과
연구 질문
- RQ1계층 간 가중치 공유를 비전 트랜스포머에 효과적으로 적용할 수 있을까? 이로 인해 학습 불안정성이나 성능 저하가 발생하지 않을까?
- RQ2ViT 블록 간 가중치 공유 시 학습을 안정화하고 성능을 유지하기 위한 메커니즘은 무엇일까?
- RQ3예측 수준, 주의 수준, 히든 상태 수준의 다중 수준 지식 정복은 정확도를 유지하면서 ViT를 얼마나 효과적으로 압축할 수 있을까?
- RQ4제안된 방법을 사용해 동형 및 계층적 ViT 아키텍처 모두에서 얼마나 높은 수준의 파라미터 감소를 달성할 수 있을까?
- RQ5압축된 MiniViT 모델은 객체 검출 및 세그멘테이션과 같은 후행 비전 작업으로의 이식성과 강도를 유지할 수 있을까?
주요 결과
- MiniViT는 사전 학습된 Swin-B 트랜스포머의 파라미터 수를 48% 감소시키면서 ImageNet에서 Top-1 정확도를 1.0% 향상시켰다.
- 이 방법은 DeiT-B를 8600만에서 900만 파라미터로(9.7배 압축) 압축하면서도 성능 저하를 최소화했다.
- 변환과 정복을 결합한 가중치 다중화 기법은 단순한 가중치 공유와 달리 학습을 안정화시키고 붕괴를 방지한다.
- 주의 수준 및 히든 상태 정복의 사용은 특히 미세조정 단계에서 검출 정복과 함께 적용되었을 때 성능 향상에 크게 기여한다.
- MiniViT는 백본에서 57%의 파라미터 감소를 달성하면서 COCO 객체 검출에서 기준 모델과 비교하여 유사한 평균 정밀도(AP)를 유지했다.
- 압축된 모델는 미세조정 후 후행 검출 및 세그멘테이션 벤치마크에서 최신 기술 수준의 성능을 달성하며 강력한 이식성을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.