Skip to main content
QUICK REVIEW

[논문 리뷰] Parameter-efficient Model Adaptation for Vision Transformers

Xuehai He, Chunyuan Li|arXiv (Cornell University)|2022. 03. 29.
Domain Adaptation and Few-Shot Learning인용 수 11
한 줄 요약

이 논문은 저랭크 크로네커 곱으로 가중치 갱신을 투영하는 파rameter 효율적인 방법인 크로네커 적응(Kronecker Adaptation, KAdaptation)을 제안한다. 소수의 샘플 설정에서 전체 모델 파rameter의 0.09%만을 사용하여 최신 기술 수준(SOTA)의 정확도를 달성한다. 이는 20개의 이미지 분류 데이터셋에서 기존 방법들보다 정확도와 파rameter 효율성 측면에서 모두 뛰어나다.

ABSTRACT

In computer vision, it has achieved great transfer learning performance via adapting large-scale pretrained vision models (e.g., vision transformers) to downstream tasks. Common approaches for model adaptation either update all model parameters or leverage linear probes. In this paper, we aim to study parameter-efficient model adaptation strategies for vision transformers on the image classification task. We formulate efficient model adaptation as a subspace training problem and perform a comprehensive benchmarking over different efficient adaptation methods. We conduct an empirical study on each efficient model adaptation method focusing on its performance alongside parameter cost. Furthermore, we propose a parameter-efficient model adaptation framework, which first selects submodules by measuring local intrinsic dimensions and then projects them into subspace for further decomposition via a novel Kronecker Adaptation (KAdaptation) method. We analyze and compare our method with a diverse set of baseline model adaptation methods (including state-of-the-art methods for pretrained language models). Our method performs the best in terms of the tradeoff between accuracy and parameter efficiency across 20 image classification datasets under the few-shot setting and 7 image classification datasets under the full-shot setting.

연구 동기 및 목표

  • 대규모 비전 트랜스포머(Vision Transformers)의 전체 미세조정에서 발생하는 높은 저장소 및 계산 비용을 해결하기 위해.
  • 선형 프로빙과 기존의 파rameter 효율적 방법들보다 정확도와 효율성의 상호보완적 트레이드오프를 향상시키기 위해.
  • 이미지 분류 작업에 대한 파rameter 효율적 ViT 적응을 위한 종합적인 벤치마크를 구축하기 위해.
  • 국소 내재 차원 분석을 통해 적응에 가장 효과적인 서브모듈을 식별하기 위해.
  • 가중치 갱신을 크로네커 곱으로 분해함으로써 파ram터 효율성을 향상시키는 새로운 방법인 KAdaptation을 개발하기 위해.

제안 방법

  • 가중치 갱신의 저차원 재매개변수화를 활용하여, 파ram터 효율적 적응을 부분공간 학습 문제로 수식화한다.
  • 빠른푸드(Fastfood) 변환을 사용하여 ViT 모듈의 국소 내재 차원을 측정함으로써 적응에 가장 중요한 구성요소를 식별한다.
  • 내재 차원이 낮은(주의층에서 300, MLP에서 575) 주의층에 KAdaptation을 적용함으로써 높은 중요도를 반영한다.
  • 공유된 느린 가중치와 저랭크 빠른 가중치를 사용하여 가중치 갱신을 크로네커 곱으로 분해함으로써 파라미터 수를 감소시킨다.
  • 사전학습된 가중치를 동결하고 크로네커 적응 갱신 행렬만 학습함으로써 추론 오버헤드를 최소화한다.
  • 저랭크 크로네커 구성요소를 효율적으로 표현하고 갱신하기 위해 매개변수화된 초복소수 곱셈을 활용한다.

실험 결과

연구 질문

  • RQ1주의(attention)와 MLP 모듈 중 어느 것이 낮은 내재 차원을 보이며, 따라서 더 효율적인 적응에 더 적합한가?
  • RQ2LoRA나 어댑터와 같은 기존 방법들보다 크로네커 기반의 가중치 갱신 분해가 더 나은 정확도-효율성 트레이드오프를 달성할 수 있는가?
  • RQ3KAdaptation은 전체 미세조정과 선형 프로빙에 비해 정확도, 파라미터 수, 메모리 사용량, 추론 속도 측면에서 어떻게 비교되는가?
  • RQ4소수의 샘플 설정과 전체 샘플 설정 모두에서 다양한 이미지 분류 벤치마크에서 일반화되는가?
  • RQ5내재 차원 측정이 효율적 적응을 위한 서브모듈 선택에 효과적으로 도움이 될 수 있는가?

주요 결과

  • KAdaptation은 소수의 샘플 설정에서 20개의 이미지 분류 데이터셋 평균 정확도 79.2%를 달성하여 LoRA 및 어댑터를 포함한 모든 기준 모델들을 능가한다.
  • KAdaptation은 전체 모델 파라미터의 0.09%만을 사용하며(LoRA의 약 45%), 매우 높은 파라미터 효율성을 확보한다.
  • 전체 미세조정 대비 86.0%의 메모리 프로필 감소를 기록했으며, 일반 ViT와 유사한 추론 속도(배치당 6.93초)를 유지한다.
  • 주의 모듈은 MLP 모듈보다 낮은 국소 내재 차원(300 대비 575)을 보이며, 이는 그들의 적응 우선순위를 정당화한다.
  • 제거 실험 결과, KAdaptation이 주의층에 적용되었을 때 MLP 적응 및 표준 어댑터 튜닝보다 우수하며, CIFAR10, CIFAR100, SUN397에서 평균 88.1%의 정확도를 기록한다.
  • KAdaptation은 어댑터 기반 방법들이 추가 레이어로 인해 12.97초 이상의 추론 지연을 유발하는 것과 달리, 낮은 추론 지연(배치당 6.93초)을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.