Skip to main content
QUICK REVIEW

[논문 리뷰] Is Self-Supervised Learning More Robust Than Supervised Learning?

Yuanyi Zhong, Haoran Tang|arXiv (Cornell University)|2022. 06. 10.
Domain Adaptation and Few-Shot Learning인용 수 12
한 줄 요약

이 논문은 다양한 데이터 분포 손상 상황에서 자기지도 대비 대비 학습(contrastive learning, CL)이 지도 학습(supervised learning, SL)보다 더 강건한지 여부를 조사한다. 다수의 모델과 데이터셋을 대상으로 픽셀 수준의 감마 왜곡부터 데이터셋 수준의 분포 이탈까지 다수 수준의 손상 요소를 적용한 결과, CL은 최종 작업 데이터 손상에 대해 일관되게 더 강건한 것으로 나타났지만, 패치 섞기 및 밝기 변화와 같은 사전 훈련 데이터 손상에는 더 취약한 것으로 나타났다. 핵심 통찰은 CL이 더 높은 특징 균일성과 안정성을 유지하며, 이는 최종 작업의 강건성 향상과 관련이 있다. 이를 바탕으로 CL의 특징 공간 성질을 모방하는 균일성 정규화 기법을 제안하여 SL의 강건성을 향상시키되 정확도를 희생시키지 않는 방식을 제시한다.

ABSTRACT

Self-supervised contrastive learning is a powerful tool to learn visual representation without labels. Prior work has primarily focused on evaluating the recognition accuracy of various pre-training algorithms, but has overlooked other behavioral aspects. In addition to accuracy, distributional robustness plays a critical role in the reliability of machine learning models. We design and conduct a series of robustness tests to quantify the behavioral differences between contrastive learning and supervised learning to downstream or pre-training data distribution changes. These tests leverage data corruptions at multiple levels, ranging from pixel-level gamma distortion to patch-level shuffling and to dataset-level distribution shift. Our tests unveil intriguing robustness behaviors of contrastive and supervised learning. On the one hand, under downstream corruptions, we generally observe that contrastive learning is surprisingly more robust than supervised learning. On the other hand, under pre-training corruptions, we find contrastive learning vulnerable to patch shuffling and pixel intensity change, yet less sensitive to dataset-level distribution change. We attempt to explain these results through the role of data augmentation and feature space properties. Our insight has implications in improving the downstream robustness of supervised learning.

연구 동기 및 목표

  • 정확도를 넘어서 데이터 분포 이탈 상황에서의 행동 차이에 중점을 두어 자기지도 대비 학습(CL)과 지도 학습(SL)의 강건성을 평가하는 것.
  • CL이 정확도에서 뛰어난 성능을 보이는 것이 실제 세계의 데이터 손상, 즉 픽셀 수준, 패치 수준, 데이터셋 수준의 왜곡에 대해 더 강건한지 여부를 조사하는 것.
  • 데이터 증강 및 특징 공간 성질이 CL과 SL 간의 관측된 강건성 차이를 설명하는 데 기여하는 역할을 분석하는 것.
  • CL의 특징 공간 성질을 모방하여 지도 학습의 사전 훈련 동안의 최종 작업 강건성을 향상시키는 균일성 정규화 기법을 개발하고 검증하는 것.
  • 사전 훈련 시와 최종 작업 시 손상 상황에서 CL과 SL 간의 행동적 분리에 대한 경험적 통찰을 제공하며, 모델 설계 및 훈련에 대한 함의를 제시하는 것.

제안 방법

  • 픽셀 수준의 감마 왜곡, 패치 수준의 섞기, 데이터셋 수준의 분포 이탈(예: 클래스 불균형, GAN 생성 데이터)을 포함한 다양한 수준의 데이터 손상에 대한 종합적인 강건성 평가를 수행한다.
  • 다양한 백본(ResNet, ViT)과 데이터셋(CIFAR, ImageNet, STL-10, Cars, Aircrafts)을 대상으로 여러 CL 알고리즘(SimCLR, MoCo, SimSiam, BYOL, BarlowTwins, SwAV, DINO)과 지도 학습을 적용한다.
  • 훈련 중 내부 클래스 특징 균일성과 외부 클래스 거리 측정을 통해 특징 공간 역학을 분석하여 학습 행동의 차이를 분석한다.
  • CL의 안정적이고 균일한 특징 분포를 모방하여 지도 학습의 사전 훈련에 균일성 정규화 항목을 도입하여 내부 클래스 특징 분산을 증가시킨다.
  • 데이터 손상과 증강 단계의 순서를 재정렬하여, 무작위 컷 오프어 증강에 간섭이 발생할 경우 CL이 패치 수준의 손상에 취약해지는지의 가설을 검증한다.
  • KNN 프로브를 사용하여 평가하고, 다양한 손상 상황에서 정확도 감소(Δ)를 측정하여 CL과 SL 간의 강건성 차이를 정량화한다.

실험 결과

연구 질문

  • RQ1자기지도 대비 학습은 픽셀 수준의 왜곡과 패치 섞기와 같은 최종 작업 데이터 손상에 대해 지도 학습보다 더 강건한가?
  • RQ2패치 섞기, 밝기 변화 등과 같은 사전 훈련 데이터 손상은 대비 학습 및 지도 학습 모델의 강건성에 어떤 영향을 미치는가?
  • RQ3대비 학습의 특징 공간 균일성과 안정성이 지도 학습에 비해 더 뛰어난 최종 작업 강건성과 관련이 있는가?
  • RQ4지도 학습의 사전 훈련에 균일성 정규화를 도입하면 정확도를 훼손하지 않으면서도 테스트 시 데이터 손상에 대한 강건성을 향상시킬 수 있는가?
  • RQ5특히 패치 섞기 상황에서, 사전 훈련 손상 상황에서 대비 학습의 강건성에 있어 데이터 증강 순서의 역할은 무엇인가?

주요 결과

  • 대비 학습은 모든 테스트 손상 유형과 데이터셋에서 일관되게 지도 학습보다 더 강건하며, 정확도 감소(Δ)가 유의미하게 낮게 나타났다.
  • 사전 훈련 손상 상황에서, 대비 학습은 데이터셋 수준의 분포 이탈(예: GAN 생성 데이터, 클래스 불균형)에 대해 더 강건했으며, 지도 학습보다 정확도 저하가 적었다.
  • 그러나 픽셀 수준의 밝기 변화와 패치 수준의 섞기와 같은 사전 훈련 손상에는 대비 학습이 지도 학습보다 더 취약했으며, 이는 손상 수준에 따라 강건성 행동이 근본적으로 다름을 시사한다.
  • 특징 공간 분석 결과, 대비 학습은 지도 학습보다 더 높고 안정적으로 증가하는 내부 클래스 특징 균일성과 낮은 내부 클래스 분산 압축을 유지하는 것으로 나타났다. 반면 지도 학습은 특징을 과도하게 압축하는 경향이 있었다.
  • 지도 학습의 사전 훈련에 균일성 정규화 항목을 도입함으로써 특징 공간의 균일성이 향상되었고, 최종 작업 강건성이 향상되어 손상된 데이터에서 KNN 정확도가 향상되었다(예: G4x4 손상에서 44.34%). 이는 청소년 정확도(94.21%)를 유지하면서도 달성되었다.
  • 데이터 손상과 증강 단계의 순서를 재정렬하면 대비 학습의 강건성이 크게 회복되었으며, 이는 무작위 컷 오프어 증강에 간섭이 발생할 경우 패치 수준의 손상에 취약해지는 것이 주요 원인임을 뒷받침하는 결과였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.