Skip to main content
QUICK REVIEW

[논문 리뷰] What Happens During Finetuning of Vision Transformers: An Invariance Based Investigation

Gabriele Merlin, Vedant Nanda|arXiv (Cornell University)|2023. 07. 12.
Advanced Neural Network ApplicationsComputer Science인용 수 3
한 줄 요약

이 논문은 비전 트랜스포머(ViTs)의 파인튜닝 중에 사전학습 기간에 학습된 불변성(invariances)이 어떻게 유지되거나 변화하는지 조사한다. STIR에서 유도된 새로운 불변성 기반 지표를 사용하여, 사전학습 과정에서 얕은 층에 전이 가능한 불변성이 유도되며, 파인튜닝 과정에서 깊은 층의 불변성이 얕은 층 쪽으로 압축된다는 것이 드러났다—이는 사전학습이 다운스트림 성능을 향상시키는 이유와 모델 표현이 적응 과정에서 어떻게 진화하는지에 대한 통찰을 제공한다.

ABSTRACT

The pretrain-finetune paradigm usually improves downstream performance over training a model from scratch on the same task, becoming commonplace across many areas of machine learning. While pretraining is empirically observed to be beneficial for a range of tasks, there is not a clear understanding yet of the reasons for this effect. In this work, we examine the relationship between pretrained vision transformers and the corresponding finetuned versions on several benchmark datasets and tasks. We present new metrics that specifically investigate the degree to which invariances learned by a pretrained model are retained or forgotten during finetuning. Using these metrics, we present a suite of empirical findings, including that pretraining induces transferable invariances in shallow layers and that invariances from deeper pretrained layers are compressed towards shallower layers during finetuning. Together, these findings contribute to understanding some of the reasons for the successes of pretrained models and the changes that a pretrained model undergoes when finetuned on a downstream task.

연구 동기 및 목표

  • 비전 트랜스포머에서 사전학습이 다운스트림 성능을 향상시키는 이유를 이해하고자 하며, 특히 전이 학습 설정에서의 원인을 분석한다.
  • 사전학습 기간에 학습된 불변성이 다운스트림 작업에 대한 파인튜닝 과정에서 어떻게 수정되거나 유지되거나 잊혀지는지 조사한다.
  • 파인튜닝 과정에서 안정성(기존 불변성 유지)과 유연성(새로운 불변성 학습) 사이의 동적 상호보완 관계를 특성화한다.
  • 기존의 표현 유사성 또는 정확도 기반 분석을 넘어서, 파인튜닝 중 층 간 불변성 이행과 변화를 정량화하는 새로운 지표를 개발한다.
  • 층별 불변성 진화를 분석하여 사전학습-파인튜닝 파라디그마의 성공 원리를 기계적 메커니즘으로 설명한다.

제안 방법

  • 특정 데이터 변형에 대해 사전학습 모델과 그 파인튜닝된 버전 간의 공유 불변성을 측정하기 위해 STIR(Similarity of Transferable Invariances)를 도입한다.
  • 파인튜닝 과정에서의 불변성 망각(사전학습 불변성 상실)과 불변성 학습(새로운 불변성 획득)을 정량화하기 위한 새로운 지표를 정의한다.
  • 다양한 벤치마크 데이터셋(예: CIFAR-10, ImageNet)과 작업을 대상으로 층 간 불변성 동역학을 분석하기 위해 이러한 지표를 적용한다.
  • 초기 학습 동역학(예: 층 간 평균 정확도 및 망각의 표준편차)과 최종 손상된 데이터에 대한 강건성 간 상관관계 분석을 통해 초기 모델 안정성의 지표를 평가한다.
  • 학습률, 최적화기, 데이터 증강 등의 하이퍼파rameter를 체계적으로 변화시켜 관찰된 불변성 패턴의 강인성을 검증한다.
  • 초기 학습 에포크의 기여도를 분리하기 위해 아블레이션 스터디를 수행한다.

실험 결과

연구 질문

  • RQ1사전학습 기간에 학습된 불변성들이 ViT 파인튜닝 과정에서 얼마나 유지되거나 망각되는가?
  • RQ2사전학습된 ViT의 깊은 층에서 유도된 불변성들은 파인튜닝 과정에서 어떻게 변화하는가? 그리고 얕은 층 쪽으로의 압축 현상이 있는가?
  • RQ3불변성 동역학(망각 및 학습)과 파인튜닝 중 모델의 강건성 간의 관계는 어떠한가?
  • RQ4특히 층 간 망각의 표준편차와 같은 초기 학습 동역학은 최종 모델의 강건성에 신뢰할 수 있는 지표가 될 수 있는가?
  • RQ5다른 최적화기(예: SGD 대비 Adam)는 불변성 동역학과 손상된 데이터에서의 성능 간 관계에 어떤 영향을 미치는가?

주요 결과

  • 사전학습은 비전 트랜스포머의 얕은 층에 전이 가능한 불변성을 유도하며, 이는 다운스트림 성능에 핵심적인 역할을 한다.
  • 사전학습 모델의 깊은 층에서 유도된 불변성들은 파인튜닝 과정에서 얕은 층 쪽으로 압축되며, 이는 표현 능력 재할당의 메커니즘을 시사한다.
  • 초기 학습 단계에서 층 간 망각의 표준편차는 최종 손상된 데이터에 대한 모델 강건성과 강하게 상관되어 있으며, 첫 20 에포크만 고려하더라도 여전히 유의미하다.
  • 이 상관관계는 초기 학습 단계에서도 강하거나 심지어 증가하여, 초기 불변성 동역학이 강건성 예측 가능성을 보이며 후속 최적화 행동의 결과가 아니라는 것을 시사한다.
  • SGD를 사용할 경우 다양한 하이퍼파rameter 설정에서도 불변성 동역학과 강건성 간의 관계는 유지되지만, Adam을 사용할 경우 일관되게 유지되지 않아 불변성 안정성에 최적화기 의존적 행동이 있음을 시사한다.
  • 이러한 발견들은 불변성 압축과 층별 망각 동역학이 ViT에서 사전학습-파인튜닝 파라디그마의 성공을 이끄는 핵심 메커니즘임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.