Skip to main content
QUICK REVIEW

[논문 리뷰] Center-wise Local Image Mixture For Contrastive Representation Learning

Hao Li, Xiaopeng Zhang|arXiv (Cornell University)|2020. 11. 05.
Domain Adaptation and Few-Shot Learning참고 문헌 33인용 수 4
한 줄 요약

이 논문은 중심 기반 국소 이미지 혼합을 통해 의미적으로 유사한 양성 샘플을 선택함으로써 특징 일반화를 향상시키는 대trastive 표현 학습 방법 CLIM을 제안한다. 클러스터 중심 가이드드 양성 샘플 선택과 cutmix 기반 데이터 혼합, 다중 해상도 증강을 결합함으로써 CLIM은 ResNet-50를 사용해 ImageNet 선형 평가에서 75.5%의 top-1 정확도를 달성하였으며, 오직 200 에포크만으로도 MoCo를 4.8% 초월한다.

ABSTRACT

Contrastive learning based on instance discrimination trains model to discriminate different transformations of the anchor sample from other samples, which does not consider the semantic similarity among samples. This paper proposes a new kind of contrastive learning method, named CLIM, which uses positives from other samples in the dataset. This is achieved by searching local similar samples of the anchor, and selecting samples that are closer to the corresponding cluster center, which we denote as center-wise local image selection. The selected samples are instantiated via an data mixture strategy, which performs as a smoothing regularization. As a result, CLIM encourages both local similarity and global aggregation in a robust way, which we find is beneficial for feature representation. Besides, we introduce \emph{multi-resolution} augmentation, which enables the representation to be scale invariant. We reach 75.5% top-1 accuracy with linear evaluation over ResNet-50, and 59.3% top-1 accuracy when fine-tuned with only 1% labels.

연구 동기 및 목표

  • 대비 학습에서 인스턴스 식별의 한계를 해결하기 위해, 샘플 간 의미적 유사성을 간과하는 문제를 해결하고자 한다.
  • 자기 지도 학습에서 局소 유사성과 전역 클러스터링 구조를 동시에 통합함으로써 특징 표현을 향상시키고자 한다.
  • 노이즈가 있는 양성 샘플의 영향을 줄이기 위해 강력한 데이터 혼합 정규화를 통해 약한 지도 학습 기반 대비 학습의 영향을 감소시키고자 한다.
  • 다중 해상도 데이터 증강을 통해 표현의 척도 불변성을 명시적으로 모델링하고자 한다.
  • 특히 저샷 파인튜닝 설정에서 최소한의 레이블 데이터로 최신 기술 수준의 성능을 달성하고자 한다.

제안 방법

  • 각 앵커 이미지에 대해 k개의 가장 가까운 이웃을 식별하고, 해당 클러스터 중심에 더 가까운 샘플들만 양성 샘플로 선택하는 중심 기반 국소 이미지 선택 기법을 제안한다.
  • 대비 손실를 정규화하기 위해 cutmix 스타일의 데이터 혼합 전략을 도입하여 예측을 부드럽게 하고 노이즈가 있는 양성 샘플에 대한 과도한 확신을 줄인다.
  • 동일한 이미지 패치를 다양한 해상도(예: 224×224 및 160×160)에서 대비함으로써 척도 불변성을 명시적으로 모델링하는 다중 해상도 증강을 적용한다.
  • 클러스터 중심을 정의하기 위해 K-means 클러스터링을 사용하며, 이는 의미적으로 관련성이 높은 양성 샘플의 선택을 안내한다.
  • 혼합된 표현에 표준 대비 손실(MoCo 스타일의 예)을 적용하여 국소 유사성과 전역 클러스터링의 이점을 결합한다.
  • 제안된 구성 요소들과 함께 표준 데이터 증강(자르기, 색상 왜곡 등)을 사용하는 표준 자기 지도 학습을 통해 모델을 종합적으로 최적화한다.

실험 결과

연구 질문

  • RQ1클러스터 중심으로부터의 거리에 기반한 양성 샘플 선택이 인스턴스 식별을 초월해 표현 학습을 향상시킬 수 있는가?
  • RQ2양성 샘플에 노이즈가 포함된 경우 cutmix를 통한 데이터 혼합이 대비 학습을 효과적으로 정규화하는가?
  • RQ3명시적인 다중 해상도 대비 학습이 자기 지도 표현 학습에서 척도 불변성과 성능 향상에 기여하는가?
  • RQ4CLIM은 특히 1%의 레이블 데이터만을 사용할 경우 저데이터 파인튜닝 설정에서 어떻게 성능을 내는가?
  • RQ5중심 기반 샘플링, 데이터 혼합, 다중 해상도 증강의 조합이 다양한 벤치마크에서 일관된 성능 향상을 이끌어내는가?

주요 결과

  • CLIM은 ResNet-50를 사용해 ImageNet 선형 평가에서 75.5%의 top-1 정확도를 달성하였으며, 오직 200 에포크만으로도 MoCo v2를 4.8% 초월한다.
  • 오직 1%의 레이블 데이터만을 사용할 경우 파인튜닝 시 CLIM은 59.3%의 top-1 정확도를 기록하였으며, 하류 작업에서 완전히 지도 학습 기반 베이스라인을 초월한다.
  • 중심 기반 양성 샘플 선택은 KNN+K-means 선택 대비 1.3% 향상되었고, 표준 MoCo v2 대비 1.8% 향상되었다.
  • cutmix 기반 데이터 혼합은 모든 샘플링 전략에서 일관되게 정확도를 향상시켰으며, 혼합 없음 대비 최대 1.8% 향상되었다.
  • 224×224 및 160×160 크기의 다중 해상도 증강은 72.3%의 정확도를 기록하였으며, 다중 크기 기반 베이스라인(69.7%)과 MoCo(800 에포크)를 크게 능가했다.
  • 제거 실험을 통해 중심 기반 선택, cutmix, 다중 해상도 증강의 조합이 가장 높은 성능을 내며, 각 구성 요소가 점진적으로 기여하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.