[논문 리뷰] No Reason for No Supervision: Improved Generalization in Supervised Models
이 논문은 다중 스케일 데이터 증강과 폐기 가능한 프로젝터 헤드, 온라인 클래스 프로토타입 계산을 결합한 지도 학습 설정을 제안하여 딥 네ural 네트워크의 일반화 성능을 향상시킨다. 이 방법은 t-ReX와 t-ReX*를 생성하며, ImageNet-1K 분류(80.2% top-1 정확도)와 전이 학습(13개 작업 평균 전이 정확도 76.2%)에서 기존의 지도 학습, 자기지도 학습, 준지도 학습 모델을 모두 능가하는 최신 기술 수준(SOTA)의 성능을 달성한다.
We consider the problem of training a deep neural network on a given classification task, e.g., ImageNet-1K (IN1K), so that it excels at both the training task as well as at other (future) transfer tasks. These two seemingly contradictory properties impose a trade-off between improving the model's generalization and maintaining its performance on the original task. Models trained with self-supervised learning tend to generalize better than their supervised counterparts for transfer learning; yet, they still lag behind supervised models on IN1K. In this paper, we propose a supervised learning setup that leverages the best of both worlds. We extensively analyze supervised training using multi-scale crops for data augmentation and an expendable projector head, and reveal that the design of the projector allows us to control the trade-off between performance on the training task and transferability. We further replace the last layer of class weights with class prototypes computed on the fly using a memory bank and derive two models: t-ReX that achieves a new state of the art for transfer learning and outperforms top methods such as DINO and PAWS on IN1K, and t-ReX* that matches the highly optimized RSB-A1 model on IN1K while performing better on transfer tasks. Code and pretrained models: https://europe.naverlabs.com/t-rex
연구 동기 및 목표
- 원래의 지도 학습 과제에서의 높은 성능와 하류 전이 과제로의 강력한 일반화 사이의 상충 관계를 해결하기 위해.
- ImageNet-1K에서 우수한 성능를 보이는 데도 불구하고 전이 학습에서 자기지도 학습 모델에 뒤지게 되는 이유를 탐구하기 위해.
- 특히 다중 컷 증강과 폐기 가능한 프로젝터를 포함한 자기지도 학습의 구성 요소를 식별하고, 원래 과제 정확도를 희생시키지 않고도 전이 가능성을 향상시키기 위해 활용하기 위해.
- 메모리 효율적인 온라인 클래스 프로토타입 계산 방법을 개발하여 표현 품질을 향상시키기 위해.
제안 방법
- 일반화 성능 향상을 위해 다중 스케일 컷을 사용한 데이터 증강을 적용한 지도 학습 설정을 도입한다.
- 에코더 뒤에 위치한 폐기 가능한 프로젝터 헤드를 사용하며, 추론 시에는 이를 제거하여 분리된 특징과 전이 가능한 표현을 유도한다.
- 최종 분류기 레이어를 메모리 큐를 통해 온라인으로 계산된 프로토타입으로 대체하여, 학습 중 동적이고 메모리 효율적인 프로토타입 업데이트를 가능하게 한다.
- 전이 성능 평가를 위해 원래의 ImageNet-1K 학습 세트를 기반으로 선형 분류기 헤드를 학습한다.
- 표준 지도 학습에 교차 엔트로피 손실을 적용하며, 최종 레이어를 고정된 클래스 가중치 대신 프로토타입을 사용하도록 수정한다.
- 다중 컷 증강, 프로젝터 설계, 프로토타입 계산이 IN1K 정확도와 전이 성능에 미치는 영향을 광범위하게 분석하는 아블레이션 스터디를 수행한다.
실험 결과
연구 질문
- RQ1다중 스케일 컷 증강은 지도 학습 모델에서 도메인 내 정확도와 전이 가능성 사이의 상충 관계에 어떤 영향을 미치는가?
- RQ2폐기 가능한 프로젝터 헤드의 설계가 지도 학습 모델의 일반화 능력에 어느 정도의 영향을 미치는가?
- RQ3온라인 클래스 프로토타입 계산은 도메인 내 정확도를 저하시키지 않고도 전이 성능 향상에 기여할 수 있는가?
- RQ4왜 일부 정규화 기법은 ImageNet-1K 정확도를 향상시키지만 전이 가능성은 감소시키는가? 이는 어떻게 완화될 수 있는가?
- RQ5지속적인 지도 학습 설정이 ImageNet-1K와 전이 학습 벤치마크에서 동시에 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- t-ReX는 13개 하류 과제 평균 전이 정확도 76.2%를 기록하여 DINO(69.9%)와 PAWS(71.6%)를 능가하는 새로운 최신 기술 수준의 평균 전이 정확도를 달성한다.
- t-ReX*는 ImageNet-1K에서 80.2% top-1 정확도를 달성하여 RSB-A1 모델(79.8%)을 초월하며, 이 벤치마크에서 지도 학습 모델의 새로운 최신 기술 수준을 수립한다.
- 온라인 클래스 프로토타입과 다중 컷 증강을 적용한 모델은 기준 모델 대비 특징의 중복도가 상당히 낮아져(DTD 기준 최대 0.15 감소) 더 효율적인 표현을 나타낸다.
- 폐기 가능한 프로젝터 헤드의 사용은 IN1K 정확도와 전이 가능성 간의 성능 트레이드오프를 제어할 수 있게 하며, 아블레이션 결과에서 원래 과제 성능을 해치지 않으면서도 일반화 능력을 향상시킨다는 점을 보여준다.
- t-ReX와 t-ReX*는 iNaturalist 2018 및 2019와 같은 긴 꼬리 분포 데이터셋에서도 강력한 성능을 유지하며, t-ReX는 각각 45.8%와 54.2%의 top-1 정확도를 기록하여 RSB-A1과 DINO를 능가한다.
- 시각화 결과 t-ReX*의 프로토타입은 더 의미 있는 의미적 일관성을 보이며, 쿼리 클래스(예: '골드피시'와 '열대어')의 가장 가까운 이웃들이 의미적으로 유의미하고 밀접하게 관련되어 있음을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.