[논문 리뷰] Robust fine-tuning of zero-shot models
이 논문은 영감 없는 사전 훈련 모델의 가중치와 미세조정된 모델의 가중치 사이를 선형으로 보간하는 강건한 미세조정 방법인 WiSE-FT를 제안한다. 이 방법은 분포 이탈 상황에서도 성능을 크게 향상시키면서도 목표 분포에서의 정확도를 유지하거나 향상시킨다. 다섯 개의 ImageNet 분포 이탈 상황에서 4–6 백분율 포인트의 성능 향상을 기록했고, 전이 학습 벤치마크에서는 0.8–3.3 백분율 포인트의 성능 향상을 기록했으며, 추론 비용은 추가로 발생하지 않는다.
Large pre-trained models such as CLIP or ALIGN offer consistent accuracy across a range of data distributions when performing zero-shot inference (i.e., without fine-tuning on a specific dataset). Although existing fine-tuning methods substantially improve accuracy on a given target distribution, they often reduce robustness to distribution shifts. We address this tension by introducing a simple and effective method for improving robustness while fine-tuning: ensembling the weights of the zero-shot and fine-tuned models (WiSE-FT). Compared to standard fine-tuning, WiSE-FT provides large accuracy improvements under distribution shift, while preserving high accuracy on the target distribution. On ImageNet and five derived distribution shifts, WiSE-FT improves accuracy under distribution shift by 4 to 6 percentage points (pp) over prior work while increasing ImageNet accuracy by 1.6 pp. WiSE-FT achieves similarly large robustness gains (2 to 23 pp) on a diverse set of six further distribution shifts, and accuracy gains of 0.8 to 3.3 pp compared to standard fine-tuning on seven commonly used transfer learning datasets. These improvements come at no additional computational cost during fine-tuning or inference.
연구 동기 및 목표
- 표준 미세조정에서 목표 분포에서의 정확도 향상과 분포 이탈에 대한 강건성 감소 사이의 상충 관계를 해결하기 위해.
- 목표 분포에서 높은 정확도를 유지하면서도 분포 이탈 상황에서의 강건성을 향상시키는 단순하고 효과적인 방법을 개발하기 위해.
- 초파rameter 조정 의존도를 줄이기 위해, 초파rameter 변화에 대해 강건한 방법을 도입하기 위해.
- 영감 없는 모델과 미세조정된 모델 간의 가중치 공간 앙상블이 표준 미세조정보다 더 나은 일반화 성능을 보이는지 확인하기 위해.
제안 방법
- 목표 분포에서 표준 엔드 투 엔드 또는 라스트 레이어 미세조정을 수행하여 미세조정된 모델을 확보한다.
- 혼합 계수 α ∈ [0,1]를 사용하여 영감 없는 모델과 미세조정된 모델의 학습된 가중치를 선형으로 보간함으로써 가중치 공간 앙상블을 구성한다.
- 최종 모델은 θ_α = (1−α)θ_zero-shot + αθ_fine-tuned로 정의되며, α는 목표 분포에서의 검증 성능에 기반하여 선택된다.
- 이 방법은 계산적으로 효율적이며, 표준 미세조정을 초과하여 추가적인 훈련 또는 추론 비용이 발생하지 않는다.
- 영감 없는 모델과 미세조정된 모델 간의 다양성은 KL 발산, Cohens Kappa 보완, 중심화된 커널 일치 보완(CKAC) 등의 다수의 지표를 사용하여 측정된다.
- 이론적 분석을 통해 NTK 영역에서 가중치 공간 앙상블이 출력 공간 앙상블을 근사함을 보여주며, 비볼록 설정에서도 효과적인 이유를 설명한다.
실험 결과
연구 질문
- RQ1표준 미세조정에서 영감 없는 모델의 분포 이탈에 대한 강건성을 훼손하지 않고도 미세조정을 수행할 수 있는가?
- RQ2미세조정의 초파rameter 선택이 강건성에 미치는 영향은 무엇이며, 이는 단순한 보간 방법으로 완화될 수 있는가?
- RQ3영감 없는 모델과 미세조정된 모델 간의 가중치 공간에서의 선형 보간이 분포 이탈 상황에서의 일반화 성능 향상에 기여하는가?
- RQ4WiSE-FT는 다양한 분포 이탈 상황에서 표준 미세조정 및 이전의 강건성 방법보다 얼마나 뛰어나게 성능을 높이는가?
주요 결과
- WiSE-FT는 다섯 개인터넷 분포 이탈 상황(이미지넷V2, 이미지넷-R, 이미지넷-스케치, 오브젝트넷, 이미지넷-A)에서 이전 연구 대비 평균 정확도를 4~6 백분율 포인트 향상시켰다.
- 이미지넷 벤치마크에서 WiSE-FT는 표준 미세조정 대비 정확도를 1.6 백분율 포인트 향상시켰으며, 강건성 향상도 유지했다.
- 추가로 여섯 개인터넷 분포 이탈 상황에서 WiSE-FT는 강건성 향상이 2~23 백분율 포인트에 이르렀다.
- 일곱 개인터넷 전이 학습 데이터셋에서 WiSE-FT는 표준 미세조정 대비 정확도 향상이 0.8~3.3 백분율 포인트에 이르렀다.
- 최적의 α는 목표 분포 성능만으로도 선택 가능하므로, 초파라미터 선택에 대해 강건하다.
- NTK 영역에서 가중치 공간 앙상블은 출력 공간 앙상블을 근사하며, 이는 그 실험적 성공에 대한 이론적 근거를 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.