[논문 리뷰] Diverse Imagenet Models Transfer Better
이 논문은 시각 모델의 전이 가능성에 있어 ImageNet 정확도 외에도 특성 다양성이 핵심 요소임을 제안한다. Controlled Label Injection (CLI)를 도입함으로써 저자들은 높은 ImageNet 정확도와 높은 특성 다양성을 동시에 확보한 모델을 생성하였으며, 이는 다양한 CNN 및 비전 트랜스포머 모델에서 다양한 후행 작업에 대해 정확도만으로는 예측하기 어려운 전이 성능을 더 잘 예측하는 校정된 점수(CIS)로 이어졌다.
A commonly accepted hypothesis is that models with higher accuracy on Imagenet perform better on other downstream tasks, leading to much research dedicated to optimizing Imagenet accuracy. Recently this hypothesis has been challenged by evidence showing that self-supervised models transfer better than their supervised counterparts, despite their inferior Imagenet accuracy. This calls for identifying the additional factors, on top of Imagenet accuracy, that make models transferable. In this work we show that high diversity of the features learnt by the model promotes transferability jointly with Imagenet accuracy. Encouraged by the recent transferability results of self-supervised models, we propose a method that combines self-supervised and supervised pretraining to generate models with both high diversity and high accuracy, and as a result high transferability. We demonstrate our results on several architectures and multiple downstream tasks, including both single-label and multi-label classification.
연구 동기 및 목표
- ImageNet 정확도 외에 모델의 전이 가능성 향상에 기여하는 요소를 규명하는 것.
- 특성 다양성이 특히 자기지도 학습 모델에서 전이 성능의 핵심 예측 변수임을 검증하는 것.
- 사전 훈련된 모델에서 정확도와 다양성 간의 제어 가능한 트레이드오프를 가능하게 하는 방법을 개발하는 것.
- ImageNet 정확도와 특성 다양성의 곱인 CIS가 정확도만으로는 전이 가능성과 더 강하게 상관됨을 보여주는 것.
- CLI로 생성된 모델이 여러 후행 작업에서 표준 미세조정 및 하이브리드 사전훈련 방법보다 우수한 성능을 보임을 보여주는 것.
제안 방법
- ImageNet 정확도와 특성 다양성의 곱인 Calibrated Imagenet Score (CIS)를 도입: CIS = ImageNet Accuracy × Feature Diversity.
- 자기지도 학습 사전 훈련 모델에 레이블 정보를 제어 가능한 방식으로 주입함으로써 특성 다양성과 정확도를 조절할 수 있는 Controlled Label Injection (CLI)를 제안.
- 특성 다양성의 두 가지 형태를 사용: (1) 클래스 간 특성 분산과 (2) 클래스 내 특성 분산을 활용해 특성 간 다양성 측정.
- 다양한 제어 주기 값(T)을 사용해 CLI를 통해 점진적으로 지도 학습 신호를 주입함으로써 자기지도 학습의 불변성을 유지.
- MS-COCO 포함 14개의 단일 레이블 및 다중 레이블 분류 데이터셋에서 선형 프로빙 및 미세조정을 통해 전이 가능성 측정.
- 다양한 전이 성능에 영향을 미치는 다양성과 정확도의 영향을 분리하기 위해 표준 지도 학습, 자기지도 학습, 하이브리드 사전훈련 베이스라인과 CLI로 생성된 모델을 비교.
실험 결과
연구 질문
- RQ1특성 다양성이 ImageNet 정확도 외에도 전이 가능성에 독립적으로 기여하는가?
- RQ2지도 학습 신호와 자기지도 학습 신호를 균형 있게 조합하는 하이브리드 사전훈련 전략이 전이 성능 향상에 기여하는가?
- RQ3전이 가능성 최대화를 위한 ImageNet 정확도와 특성 다양성 간 최적의 트레이드오프가 존재하는가?
- RQ4Calibrated Imagenet Score (CIS)는 CKA나 클래스 간 분離도와 같은 다른 지표보다 전이 성능 예측에 더 나은가?
- RQ5Controlled Label Injection (CLI)를 통해 높은 정확도와 높은 다양성을 동시에 확보한 모델을 생성할 수 있으며, 이는 후행 작업 성능 향상으로 이어지는가?
주요 결과
- ImageNet 정확도와 특성 다양성을 조합한 校정된 ImageNet 점수(CIS)는 ImageNet 정확도만으로는 전이 가능성과 더 강하게 상관됨을 보였다.
- CLI를 통해 생성된 모델는 ImageNet 정확도가 유사한 경우에도 표준 지도 학습 또는 자기지도 학습 모델보다 더 높은 전이 성능를 기록했다.
- MS-COCO 다중 레이블 분류 벤치마크에서 CLI로 생성된 모델은 기준 모델 대비 최대 3.5% 높은 Top-1 정확도를 기록했다.
- MAE로 사전 훈련된 ViT 모델의 경우 CLI는 고정된 특성 다양성을 유지하면서 ImageNet 정확도를 향상시켜 CIS와 전이 가능성 향상에 기여했다.
- DINO로 사전 훈련된 ViT의 경우 CLI는 정확도와 다양성을 동시에 증가시켰으며, T=2와 T=1에서 정확도는 동일했지만 다양성의 차이로 인해 전이 가능성에 차이가 발생했다.
- CIS 지표는 아키텍처(ResNets 및 ViTs), 사전훈련 방법(MoCo-v2, SimCLR, SwAV, DINO, MAE), 후행 작업 전반에 걸쳐 높은 성능을 보이는 모델을 성공적으로 식별했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.