[논문 리뷰] TinyCLIP: CLIP Distillation via Affinity Mimicking and Weight Inheritance
TinyCLIP는 비전-언어 모델인 CLIP와 같은 대규모 비전-언어 모델을 압축하기 위해 친화도 모방과 가중치 상속을 활용하는 새로운 다중모달 지식 정련 방법을 제안한다. 친화도 공간에서 교차 모달 특징 정렬을 모방하고, 교사 모델에서 학생 모델로 사전 훈련된 가중치를 상속함으로써, TinyCLIP는 최신 기준의 제로샷 성능을 달성한다. 기존 CLIP ViT-B/16보다 단지 8.9%의 파라미터(8.9M 파라미터)를 사용하면서도 ImageNet에서 41.1%의 상위 1 정확도를 유지하며, 원본 CLIP ViT-B/16를 초월한다.
In this paper, we propose a novel cross-modal distillation method, called TinyCLIP, for large-scale language-image pre-trained models. The method introduces two core techniques: affinity mimicking and weight inheritance. Affinity mimicking explores the interaction between modalities during distillation, enabling student models to mimic teachers' behavior of learning cross-modal feature alignment in a visual-linguistic affinity space. Weight inheritance transmits the pre-trained weights from the teacher models to their student counterparts to improve distillation efficiency. Moreover, we extend the method into a multi-stage progressive distillation to mitigate the loss of informative weights during extreme compression. Comprehensive experiments demonstrate the efficacy of TinyCLIP, showing that it can reduce the size of the pre-trained CLIP ViT-B/32 by 50%, while maintaining comparable zero-shot performance. While aiming for comparable performance, distillation with weight inheritance can speed up the training by 1.4 - 7.8 $ imes$ compared to training from scratch. Moreover, our TinyCLIP ViT-8M/16, trained on YFCC-15M, achieves an impressive zero-shot top-1 accuracy of 41.1% on ImageNet, surpassing the original CLIP ViT-B/16 by 3.5% while utilizing only 8.9% parameters. Finally, we demonstrate the good transferability of TinyCLIP in various downstream tasks. Code and models will be open-sourced at https://aka.ms/tinyclip.
연구 동기 및 목표
- CLIP와 같은 대규모 비전-언어 모델의 높은 계산 및 저장 비용을 해결하기 위해 효율적인 모델 정련을 가능하게 한다.
- 단일 모달 정련의 한계를 극복하기 위해 지식 전달 과정에서 교차 모달 상호작용을 유지한다.
- 교사 모델의 사전 훈련된 가중치를 새로운 가중치 상속 메커니즘을 통해 활용함으로써 정련 효율을 향상시킨다.
- 다단계 점진적 정련을 도입함으로써 성능 저하 없이 극한의 모델 압축을 가능하게 한다.
- 제로샷 및 후속 비전-언어 작업 전역에서 정련된 모델의 이식 가능성을 향상시킨다.
제안 방법
- 친화도 모방은 교사 모델의 시각-언어 특징 정렬 행동을 모방하도록 학생 모델을 훈련시켜, 친화도 공간에서 이미지 및 텍스트 임베딩 간의 코사인 유사도 격차를 최소화한다.
- 가중치 상속은 교사 모델에서 학생 모델로 사전 훈련된 가중치를 전달하며, k-차원 또는 k-층 가중치를 수동으로 선택하거나 학습 가능한 마스크를 사용해 중요한 파라미터를 식별한다.
- 학습 가능한 마스크는 시각 및 텍스트 브랜치에 별도로 적용되어 가장 정보가 많은 가중치를 자동으로 식별하고, 모odal 특화 중요도에 맞게 적응한다.
- 다단계 점진적 정련은 극한의 압축을 순차적 단계로 나누어, 각 학생 모델이 유사한 아키텍처를 가진 교사 모델에서 가중치를 상속함으로써 아키텍처 불일치를 줄이고 성능을 향상시킨다.
- 이 방법은 공유된 훈련 목표를 가진 이중 브랜치 아키텍처를 사용하며, 이미지-텍스트 쌍에 대한 대비 손실과 친화도 모방을 통한 지식 정련을 포함한다.
- 정련은 교차 엔트로피 손실과 정렬 손실의 조합을 사용하여 최적화되며, 교사의 출력 친화도 행렬이 학생 모델의 지도 신호로 사용된다.
실험 결과
연구 질문
- RQ1지식 전달 과정에서 비전과 언어 모달 간의 상호작용을 명시적으로 모델링함으로써 다중모달 정련을 어떻게 향상시킬 수 있는가?
- RQ2사전 훈련된 교사 모델에서의 가중치 상속이 비전-언어 모델의 정련 효율성과 최종 성능에 어떤 영향을 미치는가?
- RQ3다단계 점진적 정련 전략은 극한의 모델 압축 과정에서 성능 저하를 완화하는 데 효과적인가?
- RQ4기존의 이미지 또는 텍스트 특징에만 의존하는 전통적 정련 방법과 비교해 친화도 모방은 어떤가?
- RQ5정련된 TinyCLIP 모델은 다양한 후속 비전-언어 벤치마크에서 강력한 제로샷 및 피지컬 튜닝 성능을 유지하는가?
주요 결과
- TinyCLIP는 CLIP ViT-B/32의 크기를 50%로 줄였지만 ImageNet에서 동일한 제로샷 성능을 유지한다.
- 가중치 상속을 사용한 훈련은 초기 학습 대비 1.4배에서 7.8배 빠른 정련 속도를 제공하여 훈련 효율을 크게 향상시킨다.
- TinyCLIP ViT-8M/16는 ImageNet에서 41.1%의 제로샷 상위 1 정확도를 달성하여 원본 CLIP ViT-B/16(37.6%)를 뛰어넘으며, 파라미터의 단지 8.9%만 사용한다.
- TinyCLIP ViT-63M/32는 ImageNet-V2에서 55.7%의 상위 1 정확도를 기록하여 OpenCLIP ViT-B/32(55.1%)와 CLIP ViT-B/32(56.0%)를 초월한다.
- 다단계 점진적 정련 전략은 단일 단계 정련 대비 ImageNet에서 제로샷 정확도를 2.0% 향상시켜 지식 보존의 효과성을 입증한다.
- TinyCLIP 모델들은 강력한 이식 가능성을 보이며, 제로샷 및 선형 프로브 평가에서 23개의 후속 데이터셋에서 OpenCLIP ViT-B/32와 상위 1 정확도 차이가 2% 이내로 유지된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.