[논문 리뷰] Hierarchical Side-Tuning for Vision Transformers
이 논문은 중간 기반 활성화에서 다중 해상도 특징을 생성하기 위해 경량이며 학습 가능한 계층적 사이드 네트워크(HSN)를 사용하는 파라미터 효율적인 전이 학습 방법인 계층적 사이드 튜닝(HST)을 제안한다. HST는 뿐만 아니라 0.78M개의 핏 가능한 파라미터만을 사용하여 VTAB-1k에서 최고 성능(Top-1 정확도 76.0%)을 달성하며, 전체 미세조정보다 뛰어나고, COCO에서 객체 검출 및 세분화 작업에서 기존의 PETL 방법보다 뛰어난 성능을 보인다.
Fine-tuning pre-trained Vision Transformers (ViTs) has showcased significant promise in enhancing visual recognition tasks. Yet, the demand for individualized and comprehensive fine-tuning processes for each task entails substantial computational and memory costs, posing a considerable challenge. Recent advancements in Parameter-Efficient Transfer Learning (PETL) have shown potential for achieving high performance with fewer parameter updates compared to full fine-tuning. However, their effectiveness is primarily observed in simple tasks like image classification, while they encounter challenges with more complex vision tasks like dense prediction. To address this gap, this study aims to identify an effective tuning method that caters to a wider range of visual tasks. In this paper, we introduce Hierarchical Side-Tuning (HST), an innovative PETL method facilitating the transfer of ViT models to diverse downstream tasks. Diverging from existing methods that focus solely on fine-tuning parameters within specific input spaces or modules, HST employs a lightweight Hierarchical Side Network (HSN). This network leverages intermediate activations from the ViT backbone to model multi-scale features, enhancing prediction capabilities. To evaluate HST, we conducted comprehensive experiments across a range of visual tasks, including classification, object detection, instance segmentation, and semantic segmentation. Remarkably, HST achieved state-of-the-art performance in 13 out of the 19 tasks on the VTAB-1K benchmark, with the highest average Top-1 accuracy of 76.1%, while fine-tuning a mere 0.78M parameters. When applied to object detection and semantic segmentation tasks on the COCO and ADE20K testdev benchmarks, HST outperformed existing PETL methods and even surpassed full fine-tuning.
연구 동기 및 목표
- 다양한 최종 응용 분야를 위한 대규모 비전 트랜스포머의 미세조정에 따른 높은 계산 비용과 메모리 소비 문제를 해결하기 위해.
- 객체 검출 및 세분화와 같은 밀도 높은 예측 작업에서 파라미터 효율적 전이 학습(PETL)과 전체 미세조정 간의 성능 격차를 해소하기 위해.
- 기반 네트워크의 중간 특징을 활용하여 일반화 능력을 향상시키는 유연하고 파라미터 효율적인 프레임워크를 설계하기 위해.
- 최소한의 핏 가능한 파라미터로 높은 성능을 달성하면서도 추론 오버헤드를 낮추기 위해.
제안 방법
- 사전 학습된 ViT 기반 네트워크에서 핏 가능한 파라미터를 분리하여 효율적인 적응을 가능하게 하는 계층적 사이드 네트워크(HSN)를 도입한다.
- 메타 토큰(MetaT)을 사용하여 입력 임베딩에 학습 가능한 프롬프트를 주입함으로써 특징 표현 학습을 향상시킨다.
- 기반 네트워크의 중간 활성화를 전처리하고 정렬하기 위해 적응형 특징 브리지(AFB)를 설계한다.
- 다양한 수준의 특징을 융합하기 위해 크로스 어텐션과 피드포워드 네트워크(FFN) 모듈로 구성된 새로운 사이드 블록을 HSN에 도입한다.
- HSN의 여러 단계에 중간 특징을 세밀하게 주입함으로써 특징 정제를 향상시킨다.
- 선형 가중치 공유와 글로벌 토큰 풀링을 활용하여 효율성 향상과 글로벌 컨텍스트 통합을 강화한다.

실험 결과
연구 질문
- RQ1밀도 높은 예측 작업(예: 객체 검출 및 세분화)에서 파라미터 효율적 방법이 전체 미세조정과 유사한 성능을 달성할 수 있는가?
- RQ2사이드 네트워크의 계층적 구조가 비전 트랜스포머에서 다중 해상도 특징 학습을 어떻게 향상시키는가?
- RQ3성능과 효율성의 균형을 고려할 때, 메타 토큰과 주입 메커니즘의 최적 구성은 무엇인가?
- RQ4학습 가능한 파라미터를 사이드 네트워크로 분리함으로써 계산 비용은 감소시키지만 정확도를 손상시키지 않는가?
주요 결과
- HST는 VTAB-1k에서 평균 Top-1 정확도 76.0%를 달성하여, 전체 미세조정(65.6%)을 뛰어넘고, 핏 가능한 파라미터 수가 0.78M에 불과하다.
- COCO testdev 벤치마크에서 HST는 캐스케이드 마스크 R-CNN를 사용해 박스 AP 49.7과 마스크 AP 43.2를 기록하여 전체 미세조정을 초월했다.
- 제거 분석 결과, 세밀한 주입 메커니즘이 가장 큰 기여를 하였으며, 기준 모델 대비 APb는 5.5점, APM은 5.0점 향상되었다.
- 분류 작업에서는 단일 메타 토큰이 다수의 토큰보다 더 높은 성능을 보였고, 밀도 높은 예측 작업에서는 최대 8개의 토큰이 최적의 성능을 내는 것으로 나타났다.
- 선형 가중치 공유와 글로벌 토큰 풀링을 적용한 HSN은 효율성과 성능을 향상시켜 다수의 밀도 높은 레이어가 필요 없도록 했다.
- t-SNE와 Grad-CAM 시각화 결과, HST는 다른 PETL 방법보다 더 구분력 있고 국소화된 특징을 학습하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.