Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking Supervised Pre-training for Better Downstream Transferring

Yutong Feng, Jianwen Jiang|arXiv (Cornell University)|2021. 10. 12.
Domain Adaptation and Few-Shot Learning참고 문헌 47인용 수 9
한 줄 요약

이 논문은 내부 클래스 의미 다양성을 유지함으로써 다운스트림 전이성(transferability)을 향상시키는 새로운 지도 학습 사전학습 방법 LOOK(Leave-One-Out K-Nearest-Neighbor)을 제안한다. 동일한 클래스에 속하는 모든 이미지를 단일 클러스터로 몰아넣는 대신, LOOK은 각 이미지가 자신의 클래스 레이블을 k개의 가장 가까운 이웃들 중 대부분과 공유하도록 요구하는 kNN 기반 손실을 사용한다. 이로써 다중 모달 클래스 분포가 가능해지고, 시각적 변형을 더 잘 표현할 수 있게 되어 분류, 검출, 세그멘테이션을 포함한 다양한 다운스트림 작업에서 최신 기술(SOTA) 성능을 달성한다.

ABSTRACT

The pretrain-finetune paradigm has shown outstanding performance on many applications of deep learning, where a model is pre-trained on a upstream large dataset (e.g. ImageNet), and is then fine-tuned to different downstream tasks. Though for most cases, the pre-training stage is conducted based on supervised methods, recent works on self-supervised pre-training have shown powerful transferability and even outperform supervised pre-training on multiple downstream tasks. It thus remains an open question how to better generalize supervised pre-training model to downstream tasks. In this paper, we argue that the worse transferability of existing supervised pre-training methods arise from the negligence of valuable intra-class semantic difference. This is because these methods tend to push images from the same class close to each other despite of the large diversity in their visual contents, a problem to which referred as "overfit of upstream tasks". To alleviate this problem, we propose a new supervised pre-training method based on Leave-One-Out K-Nearest-Neighbor, or LOOK for short. It relieves the problem of overfitting upstream tasks by only requiring each image to share its class label with most of its k nearest neighbors, thus allowing each class to exhibit a multi-mode distribution and consequentially preserving part of intra-class difference for better transferring to downstream tasks. We developed efficient implementation of the proposed method that scales well to large datasets. Experimental studies on multiple downstream tasks show that LOOK outperforms other state-of-the-art methods for supervised and self-supervised pre-training.

연구 동기 및 목표

  • 기존의 지도 학습 사전학습 방법들이 내부 클래스 변동성을 단일 클러스터로 압축함으로써 업스트림 작업에 과적합되는 문제를 해결하기 위해.
  • 특히 미세 분류나 다양한 시각적 카테고리에 대해 클래스 내 의미적 차이를 유지함으로써 다운스트림 성능을 향상시키기 위해.
  • 대규모 데이터셋에서 높은 성능을 유지할 수 있도록 확장 가능하고 효율적인 kNN 기반 손실의 구현을 개발하기 위해.
  • k개의 가장 가까운 이웃들 중 다수의 동의만 요구하는 유연한 분류 제약 조건이 엄격한 크로스 엔트로피나 대비 학습보다 더 나은 일반화 성능을 이끌어내는지 확인하기 위해.

제안 방법

  • 딥 네ural 네트워크의 최종 분류기 헤드를 가중치가 부여된 kNN 분류기로 대체하여 유연하고 국소적인 결정 경계를 허용한다.
  • 각 샘플이 자신의 클래스가 k개의 가장 가까운 이웃들의 다수 클래스와 일치하는지 평가하는 데 사용되는, 유사도 기반의 손실 함수로 이심(Leave-One-Out) kNN 분류 오차를 사용한다.
  • 이 손실을 통해 엔드 투 엔드로 모델을 훈련시키며, 이는 특징 공간이 내부 클래스 다양성을 유지하도록 유도하고 다중 모달 분포를 허용한다.
  • 검출 및 세그멘테이션 작업에서 성능을 향상시키기 위해 국소성 감도를 높인 개선된 이중 증강 버전의 LOOK을 도입한다.
  • ImageNet 및 COCO와 같은 대규모 데이터셋에 적용할 수 있도록 효율적인, 미분 가능한 kNN 근사 구현을 구현한다.
  • 학습 중 온도 감쇠(temperature decay)를 적용하여 양성 샘플 선택을 안정화하고 최적화의 안정성을 향상시킨다.

실험 결과

연구 질문

  • RQ1지도 학습 사전학습에서 분류 제약 조건을 완화함으로써 내부 클래스 의미 다양성을 유지하면 다운스트림 전이성 향상에 기여할 수 있는가?
  • RQ2k개의 가장 가까운 이웃들 중 다수의 동의만 요구하는 kNN 기반 손실이 기존의 크로스 엔트로피나 대비 학습보다 더 나은 특징 표현을 이끌어내는가?
  • RQ3제안된 LOOK 방법은 다양한 다운스트림 작업에서 최신 기술(SOTA)의 지도 및 비지도 사전학습 방법과 비교해 어떻게 성능을 내는가?
  • RQ4kNN 기반 접근 방식은 어떤 정도로 고수준 의미 특징을 유지하면서도 시각적 배경이나 유사한 상관관계에 과적합되지 않을 수 있는가?

주요 결과

  • ImageNet 선형 프로빙에서 LOOK은 표준 크로스 엔트로피 및 지도 대비 학습(SupCon)보다 뛰어난 성능을 보이며, 다양한 백본 아키텍처에서 높은 정확도를 달성한다.
  • COCO 객체 검출 및 인스턴스 세그멘테이션 벤치마크에서 LOOK의 이중 증강 버전은 MoCo-v2 및 BYOL과 같은 비지도 방법과 비교해 경쟁력 있거나 더 뛰어난 성능을 기록한다.
  • 주의 맵(attention maps)의 시각화 결과 LOOK은 핵심 객체 외에도 더 많은 의미적 세부 정보에 초점을 맞추는 반면, SupCon은 레이블과 관련 없는 의미적 요소를 간과한다.
  • MoCo-v2의 주의 맵은 이미지 전반에 균일하게 분포해 있으며 이는 국소화 작업에 유리하지만, LOOK은 전역 및 국소 의미를 모두 유지함으로써 균형을 이룬다.
  • kNN 필터링을 통한 안정적인 양성 샘플 선택 덕분에, 온도 감쇠와 같은 하이퍼파라미터 선택에 대해 매우 강인한 성능을 보인다.
  • 실험 결과는 kNN 기반의 감독을 통해 내부 클래스 변동성을 유지할 경우, 특히 미세 분류 및 복잡한 시나리오 이해 작업에서 더 나은 일반화 성능을 달성할 수 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.