Skip to main content
QUICK REVIEW

[논문 리뷰] Triplet is All You Need with Random Mappings for Unsupervised Visual Representation Learning

Wenbin Li, Xuesong Yang|arXiv (Cornell University)|2021. 07. 22.
Domain Adaptation and Few-Shot Learning참고 문헌 32인용 수 5
한 줄 요약

이 논문은 하나의 음성 샘플만을 사용하는 간단한 트리플릿 기반의 대비 손실을 제안하여, 대규모 배치나 복잡한 비대칭 설계가 필요 없이 비지도 시각 표현 학습에서 최고 성능을 달성한다. 또한, 무작위 투영을 통해 표현 학습을 향상시키는 무작위 매핑 전략인 ROMA를 도입하여 다양한 SSL 방법에서 성능을 향상시킨다.

ABSTRACT

Contrastive self-supervised learning (SSL) has achieved great success in unsupervised visual representation learning by maximizing the similarity between two augmented views of the same image (positive pairs) and simultaneously contrasting other different images (negative pairs). However, this type of methods, such as SimCLR and MoCo, relies heavily on a large number of negative pairs and thus requires either large batches or memory banks. In contrast, some recent non-contrastive SSL methods, such as BYOL and SimSiam, attempt to discard negative pairs by introducing asymmetry and show remarkable performance. Unfortunately, to avoid collapsed solutions caused by not using negative pairs, these methods require sophisticated asymmetry designs. In this paper, we argue that negative pairs are still necessary but one is sufficient, i.e., triplet is all you need. A simple triplet-based loss can achieve surprisingly good performance without requiring large batches or asymmetry. Moreover, we observe that unsupervised visual representation learning can gain significantly from randomness. Based on this observation, we propose a simple plug-in RandOm MApping (ROMA) strategy by randomly mapping samples into other spaces and enforcing these randomly projected samples to satisfy the same correlation requirement. The proposed ROMA strategy not only achieves the state-of-the-art performance in conjunction with the triplet-based loss, but also can further effectively boost other SSL methods.

연구 동기 및 목표

  • 큰 배치나 메모리 백업을 통해 음성 쌍을 확보하는 데 의존하는 대비 SSL 방법의 높은 계산 비용과 복잡성을 해결하기 위해.
  • BYOL과 SimSiam와 같은 비대칭 SSL 방법에서 발생하는 붕괴 문제를 해결하기 위해, 복잡한 비대칭 설계가 필요로 하는 문제를 해결하기 위해.
  • 자기지도 표현 학습에서 하나의 음성 쌍(각 앵커당 하나)만으로도 강력한 성능을 달성할 수 있는지 탐색하기 위해.
  • 무작위성이 비지도 시각 표현 학습 향상에 미치는 역할을 조사하기 위해.
  • 기존 SSL 방법에 아키텍처 변경 없이도 성능 향상을 이끌 수 있는 플러그인 전략을 개발하기 위해.

제안 방법

  • 각 앵커 이미지당 하나의 음성 샘플만을 사용하는 트리플릿 기반의 대비 손실을 제안하여, 대규모 음성 샘플 채굴의 필요성을 크게 감소시킨다.
  • 무작위 투영을 통해 특징를 다른 공간으로 무작위로 매핑함으로써 추가적인 음성 뷰를 생성하는 간단한 데이터 증강 전략인 ROMA(RandOm MApping)를 도입한다.
  • 기본 대비 학습과 동일한 상관관계 제약 조건을 앵커와 무작위로 매핑된 뷰 간에 강제하여 강력한 특징 학습을 촉진한다.
  • ROMA를 기존 SSL 프레임워크에 플러그인 모듈로 적용하여, 백본이나 학습 절차의 변경 없이도 성능 향상을 달성한다.
  • 고정된 차원을 가진 무작위 투영 행렬을 사용하여 특징를 매핑함으로써 계산 효율성과 확장성을 확보한다.
  • 기본 대비 손실을 트리플릿 구조(앵커, 양성 뷰, 무작위로 매핑된 음성 뷰)와 함께 사용한다.

실험 결과

연구 질문

  • RQ1대규모 배치 학습이나 복잡한 비대칭 설계 없이도, 각 앵커당 하나의 음성 샘플만으로도 자기지도 시각 표현 학습에서 경쟁력 있는 성능을 달성할 수 있는가?
  • RQ2무작위 투영을 통해 특징 공간에 무작위성을 도입하면 자기지도 표현의 강건성과 일반화 능력이 향상되는가?
  • RQ3ROMA와 같은 단순한 플러그인 전략이 아키텍처 수정 없이도 기존 SSL 방법의 성능을 향상시킬 수 있는가?
  • RQ4제안된 트리플릿 기반 손실이 정확도와 학습 효율성 측면에서 대비 및 비대비 SSL 방법과 비교해 어떻게 성능을 내는가?
  • RQ5무작위 매핑이 다양한 후행 작업에서 표현 품질에 어떤 영향을 미치는가?

주요 결과

  • 제안된 트리플릿 기반 손실은 ResNet-50 백본을 사용할 때 ImageNet-1K에서 최고 성능을 기록하여 기존의 대비 및 비대비 방법을 모두 초월한다.
  • ROMA는 SimSiam 및 BYOL과 같은 기존 SSL 방법에 적용했을 때 성능 향상이著명하여 그 일반화 능력을 입증한다.
  • 최소한의 음성 쌍만으로도 강력한 성능을 달성하여 대규모 배치나 메모리 백업의 필요성을 제거한다.
  • ROMA를 통한 무작위 매핑은 특징의 다양성과 일반화 능력을 향상시켜 선형 평가 및 미세조정 벤치마크에서 더 높은 정확도를 달성한다.
  • 트리플릿 손실과 ROMA의 조합은 복잡한 아키텍처 비대칭성이나 대규모 음성 샘플 채굴 없이도 경쟁 가능한 성능을 달성한다.
  • 절단 분석을 통해 특징 투영에서의 무작위성이 붕괴를 방지하고 표현 품질을 향상시키는 데 핵심적인 역할을 한다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.