[논문 리뷰] Visual Prompting Upgrades Neural Network Sparsification: A Data-Model Perspective
이 논문은 시각적 프롬프트와 학습 가능한 웨이트 마스크를 공동 최적화하여 시각 모델의 신경망 스파arsity를 향상시키는 데이터-모델 공동 설계 프레임워크인 VPNs를 제안한다. 프롬프트와 마스크를 공동으로 훈련함으로써, VPNs는 다양한 아키텍처와 데이터셋에서 최신 기술 수준(SOTA)의 정확도를 달성하며, 이전 방법 대비 최대 95% 적은 훈련 에포크 수를 요구하고, 더 뛰어난 서브넷 이식성(subnetwork transferability)을 확보한다.
The rapid development of large-scale deep learning models questions the affordability of hardware platforms, which necessitates the pruning to reduce their computational and memory footprints. Sparse neural networks as the product, have demonstrated numerous favorable benefits like low complexity, undamaged generalization, etc. Most of the prominent pruning strategies are invented from a model-centric perspective, focusing on searching and preserving crucial weights by analyzing network topologies. However, the role of data and its interplay with model-centric pruning has remained relatively unexplored. In this research, we introduce a novel data-model co-design perspective: to promote superior weight sparsity by learning important model topology and adequate input data in a synergetic manner. Specifically, customized Visual Prompts are mounted to upgrade neural Network sparsification in our proposed VPNs framework. As a pioneering effort, this paper conducts systematic investigations about the impact of different visual prompts on model pruning and suggests an effective joint optimization approach. Extensive experiments with 3 network architectures and 8 datasets evidence the substantial performance improvements from VPNs over existing start-of-the-art pruning algorithms. Furthermore, we find that subnetworks discovered by VPNs from pre-trained models enjoy better transferability across diverse downstream scenarios. These insights shed light on new promising possibilities of data-model co-designs for vision model sparsification.
연구 동기 및 목표
- 신경망 스파arsity에서 데이터의 역할과 모델 중심 프루닝과의 상호작용에 대해 다루지 않은 바를 해결한다.
- 특히 프루닝 이후 적용될 경우 시각적 프롬프트가 희박한 시각 모델의 성능 향상에 기여할 수 있는지 조사한다.
- 시각적 프롬프트와 웨이트 마스크를 상호 보완적으로 최적화하여 높은 성능을 보이는 희박한 서브넷을 발견하는 공동 설계 패러다임을 개발한다.
- 기존 프루닝 알고리즘과 비교해 제안된 방법으로 발견된 서브넷의 효율성과 이식성 향상을 입증한다.
제안 방법
- 프루닝 과정 중에 시각적 프롬프트와 미분 가능한 웨이트 마스크를 함께 훈련하는 새로운 데이터-모델 공동 설계 프레임워크인 VPNs를 도입한다.
- 스파arsity 과정에 데이터 수준의 인덕티브 바이어스를 주입하기 위해 조절 가능한 파rameter를 가진 특수 설계된 시각적 프롬프트(패드, 랜덤, 픽스 프롬프트)를 설계한다.
- 시각적 프롬프트와 이진 마스크가 동시에 엔드 투 엔드로 업데이트되도록 공동 최적화 기법을 구현하여 최적의 희박한 서브넷을 식별한다.
- 학습 가능한 프롬프트 임베딩 공간을 활용해 관련 입력 영역에 적응적으로 주목함으로써, 희박한 모델에서의 특징 표현을 향상시킨다.
- 일반화성과 강건성을 평가하기 위해 여러 아키텍처(예: ResNet-18)와 데이터셋(예: CIFAR-100, ImageNet)에 프레임워크를 적용한다.
- 두 단계 훈련 과정을 활용: 첫 번째로 프롬프트를 사용한 마스크 탐색; 두 번째로 프롬프트를 활용한 서브넷 튜닝을 통해 점진적인 개선을 이룬다.
실험 결과
연구 질문
- RQ1모델 파인튜닝 이후 적용되는 후기 프루닝 시각적 프롬프트가 희박한 시각 모델의 성능 향상에 효과적으로 기여할 수 있는가?
- RQ2다양한 시각적 프롬프트 설계(예: 패드, 랜덤, 픽스)가 희박한 서브넷의 정확도와 수렴 속도에 어떤 영향을 미치는가?
- RQ3프루닝 파이프라인에서 마스크 탐색 단계와 서브넷 튜닝 단계에서 시각적 프롬프트의 상대적 기여도는 어떠한가?
- RQ4제안된 방법으로 발견된 서브넷이 다양한 후행 작업과 데이터셋에서 얼마나 일반화되는가?
- RQ5시각적 프롬프트와 웨이트 마스크의 공동 최적화가 성능 유지 조건에서 더 빠른 수렴과 높은 스파arsity를 달성할 수 있는가?
주요 결과
- VPNs는 LTH, GraSP, HYDRA와 같은 최신 기술 수준의 프루닝 방법보다 뛰어나 8개의 데이터셋과 3개의 아키텍처에서 더 높은 테스트 정확도를 달성한다.
- 90% 스파arsity 조건에서, VPNs는 LTH 대비 95% 적은 에포크 수, GraSP 대비 50% 적은 에포크 수, HYDRA 대비 50% 적은 에포크 수를 요구하여 훈련 효율성이 뛰어나다는 것을 입증한다.
- 패드 프롬프트 설계가 랜덤 및 픽스 프롬프트보다 일관되게 뛰어난 성능을 보이며, 패드 크기 16에서 최적의 성능을 기록한다. 더 큰 패드 크기는 성능 저하를 초래한다.
- VPNs가 발견한 서브넷은 다양한 데이터셋 간 이식성이 뛰어나, 후행 응용 분야에서 실용적인 유용성을 보여준다.
- LTH 대비 훈련 시간을 26% 감소시키고, GraSP 대비 8.97% 감소시키며, 더 높은 스파arsity를 유지하면서도 GraSP 수준의 시간 소비를 유지한다.
- 제거 분석(ablation study) 결과, 시각적 프롬프트가 마스크 탐색 단계보다 서브넷 튜닝 단계에서 더 크게 기여함을 확인하여, 후기 훈련 단계에서 프롬프트 통합의 중요성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.