Skip to main content
QUICK REVIEW

[논문 리뷰] Head2Toe: Utilizing Intermediate Representations for Better Transfer Learning

Utku Evci, Vincent Dumoulin|arXiv (Cornell University)|2022. 01. 10.
Domain Adaptation and Few-Shot Learning인용 수 16
한 줄 요약

Head2Toe는 사전학습된 모델의 모든 레이어에서 최적의 중간 특징을 선택하는 새로운 전이학습 방법을 제안하며, 전체 미세조정 성능에 근접한 성능을 달성하면서도 학습 FLOPs를 99.4% 감소시키고 저장비용을 99% 절감한다. 이는 분포 외(OOD) 전이 작업에서 미세조정을 초월하며, OOD 일반화를 위해 전체 미세조정이 필수적이라는 기존 가정에 도전한다.

ABSTRACT

Transfer-learning methods aim to improve performance in a data-scarce target domain using a model pretrained on a data-rich source domain. A cost-efficient strategy, linear probing, involves freezing the source model and training a new classification head for the target domain. This strategy is outperformed by a more costly but state-of-the-art method -- fine-tuning all parameters of the source model to the target domain -- possibly because fine-tuning allows the model to leverage useful information from intermediate layers which is otherwise discarded by the later pretrained layers. We explore the hypothesis that these intermediate layers might be directly exploited. We propose a method, Head-to-Toe probing (Head2Toe), that selects features from all layers of the source model to train a classification head for the target-domain. In evaluations on the VTAB-1k, Head2Toe matches performance obtained with fine-tuning on average while reducing training and storage cost hundred folds or more, but critically, for out-of-distribution transfer, Head2Toe outperforms fine-tuning.

연구 동기 및 목표

  • 저데이터 전이학습 환경에서 선형 프로빙과 미세조정 간의 성능 격차를 해소하기 위해.
  • 사전학습된 모델의 중간 표현에 유용한 특징가 존재하는지, 전체 네트워크를 미세조정하지 않고도 이를 직접 활용할 수 있는지 조사하기 위해.
  • 미세조정 성능를 유지하면서도 학습 및 저장 비용을 극적으로 줄이는 비용 효율적인 방법을 개발하기 위해.
  • 중간 레이어에서의 특징 선택이 분포 외(OOD) 타겟 도메인에서의 일반화를 향상시키는지 평가하기 위해.
  • 강력한 OOD 일반화를 위해 전체 미세조정이 필수적이라는 전통적 믿음을 도전하기 위해.

제안 방법

  • Head2Toe는 사전학습된 모델의 모든 레이어—최종 임bedding 레이어 포함—에서 가장 관련성이 높은 특징을 감독 기반의 임bedded 특징 선택 방법을 사용해 선별한다.
  • 특징 선택 문제를 정규화된 최적화 과제로 공식화하며, ℓ2,1-정규화된 목적함수를 사용해 정보가 풍부한 중간 표현을 식별한다.
  • 선택된 특징에 대해 단일 선형 분류 헤드를 학습시켜 효율적인 다운스트림 적응을 가능하게 한다.
  • 특징 선택은 각 단계에서 재학습이 비용이 많이 들지 않도록, 미분 가능한 대체 지표를 사용한 탐욕적 전진 선택 전략을 통해 수행된다.
  • ResNet-50와 ViT-B/16 백본을 사용해 ImageNet-2012에서 사전학습된 모델을 기반으로 VTAB 벤치마크에서 평가된다.
  • 기존의 효율적인 미세조정 방법(예: 어댑터 또는 프루닝)과 호환되도록 설계되어 있으며, 이를 함께 사용할 수 있다.

실험 결과

연구 질문

  • RQ1사전학습된 모델의 중간 표현을 미세조정 없이 직접 활용하여 전이학습 성능을 향상시킬 수 있는가?
  • RQ2사전학습된 네트워크의 다수 레이어에서 특징을 선택하는 것이 표준 선형 프로빙보다 성능을 향상시키는가?
  • RQ3Head2Toe의 정확도 및 계산 비용 측면에서 전체 미세조정과의 성능 비교는 어떠한가?
  • RQ4Head2Toe는 분포 외(OOD) 전이 작업에서 미세조정을 능가하는가?
  • RQ5간단하고 효율적인 특징 선택 방법이 고비용 전체 미세조정의 성능을 따라잡으면서도 FLOPs와 저장비용을 수십만 배 수준으로 감소시킬 수 있는가?

주요 결과

  • Head2Toe는 VTAB 벤치마크 전반에서 전체 미세조정의 평균 성능을 재현하며, 극적으로 낮은 비용으로 최신 기술 수준의 정확도를 달성한다.
  • 평균적으로 Head2Toe는 전체 미세조정 대비 학습 FLOPs를 99.4% 감소시키고 저장비용을 99% 절감하면서도 경쟁 가능한 성능을 유지한다.
  • Head2Toe는 분포 외(OOD) 타겟 도메인에서 미세조정을 능가하며, 특히 ImageNet과 낮은 도메인 유사도를 보이는 작업에서 유의미한 이점을 얻는다.
  • 선형 프로빙 대비 성능 향상은 OOD 작업에서 가장 두드러지며, 도메인 이탈이 클수록 성능 향상이 커져, 이러한 환경에서 중간 특징의 가치를 확인한다.
  • 이 방법은 컨volutional(ResNet-50)과 비전 트랜스포머(ViT-B/16)를 포함한 다양한 아키텍처에서 강력한 일반화 성능을 보여준다.
  • 성능 향상의 원인은 깊은 레이어에 숨겨진 분류에 유용한 특징을 접근하고 활용할 수 있다는 모델의 능력에 기인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.