[논문 리뷰] UPop: Unified and Progressive Pruning for Compressing Vision-Language Transformers
UPop은 시각-언어 트랜스포머를 압축하기 위한 통합적이고 점진적인 프루닝 프레임워크로, 연속 최적화를 통해 시각, 언어, 상호주의 구성 요소 간에 자동으로 적응형 프루닝 비율 할당을 가능하게 하며, 점진적 재학습을 통해 수렴성과 성능 향상을 보장한다. 이미지 분류, 캡션 생성, 세그멘테이션 작업 전반에서 최대 2배의 압축을 달성하면서 1% 이내의 정확도 손실을 기록한다.
Real-world data contains a vast amount of multimodal information, among which vision and language are the two most representative modalities. Moreover, increasingly heavier models, extit{e}. extit{g}., Transformers, have attracted the attention of researchers to model compression. However, how to compress multimodal models, especially vison-language Transformers, is still under-explored. This paper proposes the extbf{U}nified and extbf{P}r extbf{o}gressive extbf{P}runing ( extbf{\emph{UPop}}) as a universal vison-language Transformer compression framework, which incorporates 1) unifiedly searching multimodal subnets in a continuous optimization space from the original model, which enables automatic assignment of pruning ratios among compressible modalities and structures; 2) progressively searching and retraining the subnet, which maintains convergence between the search and retrain to attain higher compression ratios. Experiments on various tasks, datasets, and model architectures demonstrate the effectiveness and versatility of the proposed UPop framework. The code is available at https://github.com/sdc17/UPop.
연구 동기 및 목표
- 점점 더 크고 자원을 많이 소비하는 시각-언어 트랜스포머에 대해 효과적이고 체계적인 압축 방법의 부족을 해결한다.
- 다중모달 프루닝에서 수동으로 설정하는 프루닝 비율 할당의 비효율성과 최적화되지 않은 점을 극복한다.
- 점진적 탐색과 재학습을 통해 고압축 비율을 유지하면서 모델 수렴성과 성능을 확보한다.
- 다양한 시각-언어 작업, 데이터셋, 모델 아키텍처에 적용 가능한 통합 프레임워크를 제공한다.
- 자연어, 자기주의, 피드포워드 네트워크 등의 다양한 모odality와 구조에 대해 자동으로 프루닝 비율를 할당하여 손실 없음 또는 거의 손실이 없는 압축을 달성한다.
제안 방법
- 시각, 언어, 상호주의 구성 요소 간의 프루닝 비율를 동시에 탐색할 수 있도록 연속 최적화 기반의 통합 검색 공간을 제안한다.
- 정규화를 통한 학습 가능한 마스크($\bm{\zeta}$)를 도입하여 미분 가능 프루닝을 가능하게 하여 기울기 기반의 프루닝 비율 최적화를 허용한다.
- 점진적 프루닝 파라다임을 적용: 먼저 연속 공간에서 부분 네트워크를 탐색하고, 성능 격차를 보완하기 위해 미세조정된 가중치로 재학습한다.
- 두 단계의 훈련 방식을 사용: 학습률 $\alpha$를 사용하는 검색 단계 이후, 학습률 $\beta$를 사용하는 재학습 단계로 수렴 안정성을 향상시킨다.
- 전체 모델 크기를 제어하기 위해 총 압축 비율 $p$를 적용하며, 구성 요소별 프루닝 비율은 종단 간(end-to-end)으로 결정된다.
- 다중모달 작업으로의 확장: 통합된 방식으로 시각 및 언어 브랜치뿐 아니라 상호주의 모듈까지 함께 프루닝한다.
실험 결과
연구 질문
- RQ1시각-언어 트랜스포머의 시각, 언어, 상호주의 구성 요소 간에 통합적이고 연속 최적화 프레임워크가 자동으로 최적의 프루닝 비율를 할당할 수 있는가?
- RQ2특히 고압축 비율에서, 표준 일괄 프루닝 대비 점진적 재학습이 수렴성과 성능 향상에 기여하는가?
- RQ3다중모달 작업에서 기존의 단모달 프루닝 기준(예: ViT-Slimming)과 비교해 UPop의 정확도 및 압축 효율성은 어떠한가?
- RQ4다양한 시각-언어 작업에서 고압축 비율(예: 2배)에서도 근접한 손실 없음 압축(≤1% 정확도 손실)을 UPop이 달성할 수 있는가?
- RQ5다양한 작업(예: 이미지 분류 대비 의미 세그멘테이션)에서 재구성 가능성 수준이 다른 경우 UPop의 성능는 어떻게 변하는가?
주요 결과
- UPop은 DeiT에서 최대 2배의 압축(1140만 파라미터)을 달성하면서 상위 1위 정확도가 1.0% 감소에 그쳐, 유사한 압축 수준에서 기준 방법들을 능가한다.
- 이미지 분류 작업에서 UPop은 1.11배의 압축(1990만 파라미터)에서도 상위 1위 정확도 81.1을 유지하며 원본 DeiT 대비 1.2% 향상되었다.
- ADE20k 세그멘테이션 작업에서 UPop은 1.1배의 압축을 달성하면서 mIoU가 0.6% 향상(45.9 vs. 45.3)되고 FLOPs가 13% 감소했으며, 기준 방법을 능가했다.
- 1.42배의 압축에서 UPop은 상위 1위 정확도 80.2를 유지하며 정확도 손실이 0.3%에 불과했고 FLOPs는 30% 감소시켰다. 이는 고압축에서도 뛰어난 성능을 보였다.
- 이미지 분류 작업에서는 1.5배의 손실 없는 압축을 달성했고, 세그멘테이션 작업에서는 1.4배의 압축을 통해 <1% mIoU 손실을 기록하여 분류 작업에서 더 높은 압축 가능성을 보였다.
- 점진적 재학습 방식은 수렴성을 크게 향상시켜, 표준 프루닝 방법과 달리 성능 저하 없이 고압축 비율을 달성할 수 있도록 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.