Skip to main content
QUICK REVIEW

[논문 리뷰] MixSiam: A Mixture-based Approach to Self-supervised Representation Learning

X. Guo, Tianhao Zhao|arXiv (Cornell University)|2021. 11. 04.
Domain Adaptation and Few-Shot Learning참고 문헌 51인용 수 8
한 줄 요약

MixSiam는 특성 최대화를 통한 분류 표현에 대한 불변성과 MixUp를 통한 하드 증강 샘플 도입을 통해 시아비스 대비 대비 학습을 향상시키는 혼합 기반 자기 지율 학습 방법을 제안한다. 이 방법은 동일한 훈련 설정에서 ImageNet과 소규모 데이터셋에서 최신 기술 수준의 성능을 달성하며, 더 높은 견고성과 일반화 능력을 보이며, ImageNet에서 SimSiam를 최대 0.64% 높은 정확도로 능가한다.

ABSTRACT

Recently contrastive learning has shown significant progress in learning visual representations from unlabeled data. The core idea is training the backbone to be invariant to different augmentations of an instance. While most methods only maximize the feature similarity between two augmented data, we further generate more challenging training samples and force the model to keep predicting discriminative representation on these hard samples. In this paper, we propose MixSiam, a mixture-based approach upon the traditional siamese network. On the one hand, we input two augmented images of an instance to the backbone and obtain the discriminative representation by performing an element-wise maximum of two features. On the other hand, we take the mixture of these augmented images as input, and expect the model prediction to be close to the discriminative representation. In this way, the model could access more variant data samples of an instance and keep predicting invariant discriminative representations for them. Thus the learned model is more robust compared to previous contrastive learning methods. Extensive experiments on large-scale datasets show that MixSiam steadily improves the baseline and achieves competitive results with state-of-the-art methods. Our code will be released soon.

연구 동기 및 목표

  • 큰 내부 클래스 변동성을 다룰 때 시아비스 대비 학습의 제한된 견고성을 해결하기 위해.
  • 표준 데이터 증강을 초월한 하드하고 다양한 훈련 샘플을 도입하여 모델의 일반화 능력을 향상시키기 위해.
  • 동일한 이미지의 두 증강된 시각에서 최대로 정보가 많은 표현을 학습하여 특징의 분류 능력을 향상시키기 위해.
  • 더 강력한 불변성 제약 조건을 활용하여 더 작은 배치 크기로도 경쟁 가능한 성능을 달성하기 위해.

제안 방법

  • 모델은 동일한 이미지의 두 증강된 시각을 처리하기 위해 공유 가중치를 가진 시아비스 인코더 구조를 사용한다.
  • 두 증강된 시각의 특징 표현은 요소별 최댓값을 통해 조합되어 가장 정보가 많은 특징을 포착하는 분류 표현을 형성한다.
  • 두 증강된 시각을 선형 혼합하여 MixUp를 사용해 제3의 입력을 생성하며, 이는 모델이 예측해야 할 하드하고 도전적인 샘플이 된다.
  • 예측 헤드는 분류 표현과 유사한 예측을 생성하도록 훈련되어 다양한 입력에 대한 불변성을 강제한다.
  • 가중치가 부여된 손실 함수는 양성 쌍에 대한 대비 손실과 혼합 샘플에 대한 일관성 손실을 조합하며, 하이퍼파rameter λ가 두 손실 성분을 균형 잡는다.
  • 표준 데이터 증강(자르기, 색상 왜곡, 흐림, 무작위 회색조)과 MixUp을 활용해 다양한 훈련 샘플을 생성한다.

실험 결과

연구 질문

  • RQ1MixUp를 통한 가상의 하드 샘플 도입이 시아비스 대비 학습 프레임워크 내 자기 지율 표현 학습의 견고성 향상에 기여하는가?
  • RQ2증강된 시각 간의 특징 최대화와 혼합 샘플에 대한 불변성 조합이 표준 대비 학습보다 더 나은 일반화를 이끌어내는가?
  • RQ3쉬운 양성 쌍과 하드한 혼합 샘플 간의 균형이 모델 성능에 미치는 영향은 무엇이며, 최적의 트레이드오프는 무엇인가?
  • RQ4MixSiam는 최신 기술 수준의 방법과 비교해 더 작은 배치 크기로도 경쟁 가능한 정확도를 달성할 수 있는가?

주요 결과

  • CIFAR-10에서 MixSiam는 93.35%의 Top-1 정확도를 달성하여 SimSiam 기준선을 0.64% 높게 기록한다.
  • ImageNet에서는 배치 크기가 256일 때 81.9%의 Top-1 정확도를 기록하며, 유사한 훈련 조건에서 최신 기술 수준의 방법들과 동등하거나 이를 초월한다.
  • 제거 분석 결과 특징 최대화(최대값 집계)가 가장 높은 성능을 내며, 평균 풀링 대비 0.64% 높은 정확도를 기록한다.
  • 하이퍼파rameter λ = 0.5가 최적의 균형을 제공하며, 두 손실 성분을 적절히 조율하여 다양한 데이터셋에서 최고의 성능을 낸다.
  • 시각화 결과 혼합 이미지는 시각적으로 흐릿하고 겹치는 특징을 포함하여 예측에 도전적이며, 이는 모델의 견고성 향상에 기여한다.
  • 이 방법은 CIFAR-10, CIFAR-100, Food101를 포함한 여러 벤치마크에서 일관되게 성능 향상을 보이며 강력한 일반화 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.