Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Adaptation of Large Vision Transformer via Adapter Re-Composing

Wei Dong, Dawei Yan|arXiv (Cornell University)|2023. 10. 10.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 레이어 간에 내림 및 올림 투영 행렬을 공유하고, 레이어 적응형 어댑터를 생성하기 위해 저차원 재조합 계수를 학습하는 방식으로, 대규모 비전 트랜스포머를 미세조정하기 위한 파rameter 효율적인 방법인 어댑터 재조합(ARC)을 제안한다. 이 방법은 적응 파ram터 수를 줄이면서도 24개의 이미지 분류 작업 전반에서 강력한 전이 학습 성능을 유지한다.

ABSTRACT

The advent of high-capacity pre-trained models has revolutionized problem-solving in computer vision, shifting the focus from training task-specific models to adapting pre-trained models. Consequently, effectively adapting large pre-trained models to downstream tasks in an efficient manner has become a prominent research area. Existing solutions primarily concentrate on designing lightweight adapters and their interaction with pre-trained models, with the goal of minimizing the number of parameters requiring updates. In this study, we propose a novel Adapter Re-Composing (ARC) strategy that addresses efficient pre-trained model adaptation from a fresh perspective. Our approach considers the reusability of adaptation parameters and introduces a parameter-sharing scheme. Specifically, we leverage symmetric down-/up-projections to construct bottleneck operations, which are shared across layers. By learning low-dimensional re-scaling coefficients, we can effectively re-compose layer-adaptive adapters. This parameter-sharing strategy in adapter design allows us to significantly reduce the number of new parameters while maintaining satisfactory performance, thereby offering a promising approach to compress the adaptation cost. We conduct experiments on 24 downstream image classification tasks using various Vision Transformer variants to evaluate our method. The results demonstrate that our approach achieves compelling transfer learning performance with a reduced parameter count. Our code is available at \href{https://github.com/DavidYanAnDe/ARC}{https://github.com/DavidYanAnDe/ARC}.

연구 동기 및 목표

  • 미세조정 시 학습 가능한 파ram터 수를 줄여 대규모 사전학습된 비전 트랜스포머를 적응시키는 데 드는 높은 비용을 해결하기 위해.
  • 기존 어댑터 방법이 레이어 수에 따라 선형적으로 증가하는 한계를 극복하기 위해 파라미터 재사용을 도입하기 위해.
  • 저랭크 적응 매트릭스가 레이어 간에 공유 기반 투영을 통해 효과적으로 재조합될 수 있는지 탐색하기 위해.
  • 추론 비용을 증가시키지 않으면서도 성능을 유지하는 가볍고 확장 가능한 어댑터 설계를 개발하기 위해.

제안 방법

  • 대칭 내림 투영 및 올림 투영 행렬을 사용한 저랭크 어댑터 구조를 도입하여 버티컬 블로킹 연산을 형성한다.
  • 모든 레이어 간에 내림 및 올림 투영 행렬을 공유함으로써 학습이 필요한 고유 파라미터 수를 감소시킨다.
  • 각 레이어에 맞는 재조합 계수(저차원 벡터)를 학습하여 어댑터의 효과적 투영을 동적으로 조정한다.
  • 멀티헤드 어텐션(MHA) 및 피드포워드 네트워크(FFN) 모듈의 앞에 어댑터를 위치시켜 포괄적인 특징 적응을 가능하게 한다.
  • 레이어 수에 따라 파라미터 수가 선형적으로 증가하지 않도록 보장하는 파aram터 공유 기반 설계를 사용한다.
  • 추론 시 추가 계산을 방지하는 방식으로 어댑터를 배치함으로써 추론 효율성을 유지한다.

실험 결과

연구 질문

  • RQ1비전 트랜스포머에서 어댑터 파라미터를 레이어 간에 효과적으로 재사용하여 학습 가능한 파라미터 수를 줄일 수 있는가?
  • RQ2내림 및 올림 투영 행렬을 레이어 간에 공유하면서 오직 재조합 계수만 학습하는 방식이 성능 저하 없이 더 높은 파라미터 효율성을 달성할 수 있는가?
  • RQ3버티컬 블로킹 차원의 선택이 성능와 파라미터 수 사이의 트레이드오���에 어떤 영향을 미치는가?
  • RQ4MHA/FFN 모듈의 앞 또는 뒤에 어댑터를 배치할 경우, 전이 학습 성능을 최대화하기 위해 최적의 위치는 어디인가?
  • RQ5삽입된 어댑터 레이어의 수가 최종 성능에 어떤 영향을 미치며, 순차적 또는 병렬적 삽입 방식 중 어느 것이 더 좋은 성능을 낼 수 있는가?

주요 결과

  • 버티컬 블로킹 차원이 50일 때 성능과 파라미터 효율성 사이의 최적의 균형을 이룬다. 10차원일 경우 성능 저하가 발생하고, 더 높은 차원에서는 성능이 악화된다.
  • MHA 및/또한 FFN 모듈 뒤에 어댑터를 배치하는 것은 MHA 및 FFN 모듈 앞에 어댑터를 배치하는 것보다 성능 저하를 초래한다.
  • MHA와 FFN 양쪽에 어댑터를 사용하는 것이 한쪽만 사용하는 것보다 더 높은 성능을 낸다. 이는 다중 모듈 적응의 이점이 있음을 시사한다.
  • 파라미터 공유 설계는 성능 손실 없이 학습 가능한 파라미터 수를 크게 줄였으며, 비공유 또는 비대칭 설계는 파라미터 수를 늘리지만 성능 향상 없이 결과를 개선하지 못한다.
  • 첫 번째 여섯 레이어에 어댑터를 삽입하는 것이 마지막 여섯 레이어에 삽입하는 것보다 더 높은 성능을 낸다. 이는 초기 레이어가 적응에서 더 많은 이점을 얻는다는 것을 시사한다.
  • 파라미터 공유 설계는 어댑터 파라미터 수가 레이어 수에 따라 선형적으로 증가하지 않음을 보장하여 더 깊은 모델에 대한 더 나은 확장성을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.