[논문 리뷰] How to Fine-Tune Vision Models with SGD
이 논문은 시각 변환기와 ConvNeXts에서 분포 이탈 상황에서 SGD가 AdamW보다 성능이 열 劣하는 이유를 임bedding 레이어의 비례적으로 큰 기울기 때문으로 규명한다. 이 작은 레이어(<1% 파라미터)를 고정함으로써 SGD는 메모리 사용을 크게 줄이며 AdamW와 동등하거나 뛰어난 성능을 달성하게 되어 다섯 개인 분포 이탈 벤치마크에서 최신 기술 수준의 정확도를 확보한다.
SGD and AdamW are the two most used optimizers for fine-tuning large neural networks in computer vision. When the two methods perform the same, SGD is preferable because it uses less memory (12 bytes/parameter with momentum and 8 bytes/parameter without) than AdamW (16 bytes/parameter). However, on a suite of downstream tasks, especially those with distribution shifts, we find that fine-tuning with AdamW performs substantially better than SGD on modern Vision Transformer and ConvNeXt models. We find that large gaps in performance between SGD and AdamW occur when the fine-tuning gradients in the first "embedding" layer are much larger than in the rest of the model. Our analysis suggests an easy fix that works consistently across datasets and models: freezing the embedding layer (less than 1% of the parameters) leads to SGD with or without momentum performing slightly better than AdamW while using less memory (e.g., on ViT-L, SGD uses 33% less GPU memory). Our insights result in state-of-the-art accuracies on five popular distribution shift benchmarks: WILDS-FMoW, WILDS-Camelyon, BREEDS-Living-17, Waterbirds, and DomainNet.
연구 동기 및 목표
- 분포 이탈 데이터셋에서 시각 모델을 미세조정할 때 AdamW가 SGD보다 성능이 뛰어나는 이유를 이해하는 것.
- 현대적 시각 아키텍처에서 SGD와 AdamW 간 성능 격차의 근본 원인을 규명하는 것.
- AdamW 성능을 따라하거나 능가하는 최소한의 메모리 효율적 수정 방법을 제안하는 것.
- 메모리나 계산 비용을 늘리지 않고 분포 이탈 벤치마크에서 최신 기술 수준의 성능을 달성하는 것.
제안 방법
- SGD 미세조정 중 첫 번째 임베딩 레이어(파라미터의 1% 미만)를 고정하여 초기 기울기 값이 큰 업데이트로 인한 과적합을 방지한다.
- 여러 모델과 데이터셋에서 모멘텀 유무 및 임베딩 레이어 고정 여부에 따라 SGD를 비교한다.
- 레이어 간 초기 기울기 노름을 분석하여 임베딩 레이어에서 비례적으로 큰 기울기 크기를 규명한다.
- 기울기 노름을 파라미터 노름과 √(파라미터 수)로 정규화하여 레이어 간 상대적 업데이트 크기를 평가한다.
- 메모리 사용량을 프로파일링하여 제안된 방법이 AdamW 대비 메모리 우수성을 정량화한다.
- 다섯 개인 분포 이탈 벤치마크에서 성능을 평가한다: WILDS-FMoW, WILDS-Camelyon, BREEDS-Living-17, Waterbirds, DomainNet.
실험 결과
연구 질문
- RQ1분포 이탈 데이터셋에서 시각 변환기와 ConvNeXts를 미세조정할 때 AdamW가 SGD보다 성능이 뛰어나는 이유는 무엇인가?
- RQ2이러한 환경에서 SGD가 AdamW에 비해 성능이 열 劣하는 데 기여하는 모델의 구조적 또는 최적화적 특성은 무엇인가?
- RQ3작은 크기이지만 임베딩 레이어를 고정하는 것이 미세조정 시 SGD의 일관된 성능 향상에 기여하는가?
- RQ4모멘텀이 없는 메모리 효율적인 SGD 변종이 OOD 일반화에서 표준 SGD와 AdamW를 모두 능가할 수 있는가?
- RQ5임베딩 레이어를 고정함으로써 얻는 성능 향상은 기울기 폭발 감소 때문인가, 아니면 AdamW의 적응형 학습률이 가져오는 독립적 향상인가?
주요 결과
- CLIP ViT-B/16에서 AdamW는 표준 SGD보다 내부 분포 정확도가 2.1% 높고, 외부 분포 정확도는 8.1% 높다.
- 임베딩 레이어를 고정함으로써 SGD는 AdamW 성능을 따라하거나 능가하게 되어 모든 모델과 데이터셋에서 76.7%의 OOD 정확도를 달성한다.
- ViT-B/16과 ViT-L/14에서 AdamW의 메모리 오버헤드는 각각 SGD(임베딩 고정, 모멘텀 없음)보다 18%와 49% 높다.
- 임베딩 레이어를 고정하고 모멘텀을 사용하지 않는 SGD는 76.9%의 OOD 정확도를 기록하여 AdamW와 표준 SGD보다 略 높은 성능을 달성한다.
- 기울기 분석 결과, SGD 미세조정 모델에서 임베딩 레이어의 기울기 노름은 다른 레이어보다 2–3배 크며, AdamW 미세조정 모델에서는 10배 이상 크다.
- 임베딩 레이어를 고정함으로써 SGD와 AdamW 간 성능 격차가 사라지므로, 이는 SGD의 성능 열 劣의 주요 원인임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.