Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Feature Learning by Cross-Level Instance-Group Discrimination

Xudong Wang, Ziwei Liu|arXiv (Cornell University)|2020. 08. 09.
Advanced Image and Video Retrieval Techniques참고 문헌 74인용 수 13
한 줄 요약

이 논문은 인스턴스 수준과 그룹 수준의 구분을 동시에 최적화함으로써 특징 표현을 향상시키는 대비형 자기 지율 학습 방법인 Cross-Level Instance-Group Discrimination (CLD)을 제안한다. 특징를 의미론적 그룹으로 군집화하고 인스턴스와 그룹 프로토타입 간의 대비 손실을 적용함으로써 CLD는 다운스트림 분류 정확도를 향상시키며, ImageNet-100에서 MoCo+CLD를 사용해 최신 기준(SOTA)을 달성한다(Top-1 정확도 81.7%).

ABSTRACT

Unsupervised feature learning has made great strides with contrastive learning based on instance discrimination and invariant mapping, as benchmarked on curated class-balanced datasets. However, natural data could be highly correlated and long-tail distributed. Natural between-instance similarity conflicts with the presumed instance distinction, causing unstable training and poor performance. Our idea is to discover and integrate between-instance similarity into contrastive learning, not directly by instance grouping, but by cross-level discrimination (CLD) between instances and local instance groups. While invariant mapping of each instance is imposed by attraction within its augmented views, between-instance similarity could emerge from common repulsion against instance groups. Our batch-wise and cross-view comparisons also greatly improve the positive/negative sample ratio of contrastive learning and achieve better invariant mapping. To effect both grouping and discrimination objectives, we impose them on features separately derived from a shared representation. In addition, we propose normalized projection heads and unsupervised hyper-parameter tuning for the first time. Our extensive experimentation demonstrates that CLD is a lean and powerful add-on to existing methods such as NPID, MoCo, InfoMin, and BYOL on highly correlated, long-tail, or balanced datasets. It not only achieves new state-of-the-art on self-supervision, semi-supervision, and transfer learning benchmarks, but also beats MoCo v2 and SimCLR on every reported performance attained with a much larger compute. CLD effectively brings unsupervised learning closer to natural data and real-world applications. Our code is publicly available at: https://github.com/frank-xwang/CLD-UnsupervisedLearning.

연구 동기 및 목표

  • 의미론적 구조를 포착하는 데 한계가 있는 인스턴스 수준의 대비 학습을 개선하기 위해 그룹 수준의 구분을 도입한다.
  • 더러운 그룹 프로토타입을 활용해 인스턴스 수준의 대비 학습을 이끄는 것으로 특징 표현 품질을 향상시킨다.
  • 온도 T와 인스턴스 및 그룹 손실 간의 균형을 제어하는 가중치를 통해 하이퍼파rameter에 대한 민감도를 감소시킨다.
  • 선형 프로빙, 객체 검출, 준지도 학습과 같은 다양한 다운스트림 작업에서의 일반화 성능 향상을 입증한다.
  • ImageNet, CIFAR, STL-10, Kitchen-HC와 같은 다양한 데이터셋에서 CLD의 효과를 검증하며, 다양한 시각 간의 높은 상관성을 보인다.

제안 방법

  • 코사인 유사도를 사용해 군집 중심을 계산하는 구면 k-평균 군집화를 적용하여 특징 임bedding을 k개의 의미론적 군집으로 분류한다.
  • 인스턴스 수준과 그룹 수준의 구분을 동시에 고려하는 통합 대비 손실을 도입: 양성 쌍 간의 유사도를 최소화하고, 음성 인스턴스와 그룹 프로토타입 간의 분리를 최대화한다.
  • 인스턴스 수준과 그룹 수준의 대비 목표 기여도를 조절하기 위해 학습 가능한 가중치 하이퍼파rameter λ를 사용한다.
  • 온도 스케일링 T를 대비 손실에 적용하며, 인스턴스 및 그룹 항목 모두에서 T_I = T_G로 동일하게 설정하고 코사인 학습률 스케줄링을 통해 최적화한다.
  • MoCo, NPID, BYOL과 같은 기존 대비 프레임워크와 호환되는 플러그인 모듈로 CLD를 구현하여 표준 데이터 증강 기법을 사용한 엔드 투 엔드 학습을 가능하게 한다.
  • MoCo 스타일 학습에서 음성 키를 위한 메모리 백을 사용하며, 국소적 및 전역적 상호정보를 균형 잡기 위해 메모리 백 크기의 영향을 분석하는 아블레이션 연구를 수행한다.

실험 결과

연구 질문

  • RQ1인스턴스 수준의 대비 학습을 넘어서 인스턴스-그룹 동시 구분이 자기 지율 특징 학습을 향상시킬 수 있는가?
  • RQ2군집화 방법의 선택(예: k-평균 대비 스펙트럴 군집화)이 그룹 프로토타입 품질과 다운스트림 성능에 미치는 영향은 어떠한가?
  • RQ3λ로 제어되는 인스턴스 수준과 그룹 수준의 대비 신호 간 최적의 균형은 무엇인가?
  • RQ4CLD는 온도 T에 얼마나 민감한가? 기존 대비 학습 대비 그룹 수준 정규화가 이 민감도를 감소시키는가?
  • RQ5CLD는 의미적으로 유사하지만 시각적으로 다를 수 있는 샘플들에 대해 제로샷 일반화 및 검색 성능을 향상시키는가?

주요 결과

  • MoCo+CLD를 사용해 ImageNet-100에서 81.7%의 Top-1 정확도를 달성하며, MoCo 대비 4.1%p 향상되어 새로운 최신 기준(SOTA)을 수립한다.
  • λ = 0.25일 때 CLD는 최적의 성능을 기록하며, λ를 1.0 이상으로 높이면 그룹 수준 신호에 대한 과잉 페널티로 인해 정확도가 최대 3.1%p 하락한다.
  • CIFAR-100과 ImageNet-100에서 T = 0.2일 때 최고의 성능을 기록하며, CLD는 기준 방법 대비 온도 T에 대한 민감도를 감소시킨다.
  • CLD는 검색 품질을 크게 향상시킨다: NPID+CLD는 NPID가 질감 편향으로 인해 실패하는 경우(예: 초콜릿 소스) 의미론적으로 유사한 이미지를 성공적으로 검색한다.
  • 높은 시각 상관성을 가진 Kitchen-HC 데이터셋에서도 CLD는 강력한 성능을 유지하며, 상관관계가 높은 양성 샘플에 대한 내성성을 입증한다.
  • 준지도 학습에서 선형 헤드를 사용한 CLD는 1% 및 10% ImageNet-1k 레이블링 데이터 분할에서 최신 기준 성능을 달성하며, 최적 하이퍼파ram터는 기본 학습률 0.01 및 헤드 배수 100이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.