Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking Evaluation Protocols of Visual Representations Learned via Self-supervised Learning

Jun Ho Lee, Do‐Young Yoon|arXiv (Cornell University)|2023. 04. 07.
Domain Adaptation and Few-Shot Learning인용 수 6
한 줄 요약

이 논문은 자기지도 학습 시각 표현에 대한 표준 평가 프로토콜에서 심각한 결함을 밝혀내며, 선형 프로빙(LP)과 전이 학습(TL) 성능이 입력 정규화 및 SSL 가중치 감소와 같은 초매개변수에 매우 민감함을 보여줍니다. 저자들은 LP 이전에 배치 정규화를 적용하고, 최적의 SSL 가중치 감소(0.04 → 0.2)를 사용할 경우 평가의 안정성과 전이 가능성의 향상이 극명하게 이루어짐을 입증합니다. 이는 현재의 평가 지표가 실제 전이 성능에 영향을 주는 숨겨진 초매개변수 의존성을 탐지하지 못하고 있음을 드러냅니다.

ABSTRACT

Linear probing (LP) (and $k$-NN) on the upstream dataset with labels (e.g., ImageNet) and transfer learning (TL) to various downstream datasets are commonly employed to evaluate the quality of visual representations learned via self-supervised learning (SSL). Although existing SSL methods have shown good performances under those evaluation protocols, we observe that the performances are very sensitive to the hyperparameters involved in LP and TL. We argue that this is an undesirable behavior since truly generic representations should be easily adapted to any other visual recognition task, i.e., the learned representations should be robust to the settings of LP and TL hyperparameters. In this work, we try to figure out the cause of performance sensitivity by conducting extensive experiments with state-of-the-art SSL methods. First, we find that input normalization for LP is crucial to eliminate performance variations according to the hyperparameters. Specifically, batch normalization before feeding inputs to a linear classifier considerably improves the stability of evaluation, and also resolves inconsistency of $k$-NN and LP metrics. Second, for TL, we demonstrate that a weight decay parameter in SSL significantly affects the transferability of learned representations, which cannot be identified by LP or $k$-NN evaluations on the upstream dataset. We believe that the findings of this study will be beneficial for the community by drawing attention to the shortcomings in the current SSL evaluation schemes and underscoring the need to reconsider them.

연구 동기 및 목표

  • 자기지도 학습 시각 표현에 대한 선형 프로빙과 전이 학습 평가가 동일한 SSL 모델을 사용함에도 불구하고 초매개변수 설정에 따라 성능이 크게 달라지는 이유를 조사하는 것.
  • 현재 평가 프로토콜에서 간과된 요소들이 성능 측정의 일관성과 안정성에 악영향을 미치는 이유를 규명하는 것.
  • 입력 정규화와 SSL 가중치 감소가 평가 신뢰성에 영향을 주는 핵심 숨겨진 초매개변수임을 입증하는 것.
  • 학습된 표현의 강건성과 일반화 능력을 보장하기 위해 표준 SSL 평가 체계를 재고할 것을 제안하는 것.

제안 방법

  • LP 및 TL 프로토콜 전반에서 다양한 초매개변수 설정을 적용해 최신의 SSL 모델을 광범위하게 교차 평가하는 것.
  • LP에서 선형 분류기 이전에 배치 정규화를 적용하여 성능 안정성과 k-NN 지표와의 일관성에 미치는 영향을 평가하는 것.
  • SSL 사전학습 중 가중치 감소 초매개변수를 체계적으로 변화시켜, 하류 작업에서의 TL 성능과 수렴에 미치는 영향을 분석하는 것.
  • 2차원 시각화를 통해 손실 곡면을 분석하여, 다양한 SSL 가중치 감소 설정 간의 일반화 행동을 비교하는 것.
  • 중심화된 커널 일치도(CKA)를 사용해 피처 재사용성과 표현의 전이 가능성 측정을 사전 및 미세조정 후에 비교하는 것.
  • 다른 SSL 가중치 감소 값으로 학습된 모델 간의 검증 손실 곡선, 손실 곡면, CKA 점수를 비교하여 강건성과 전이 가능성 평가하는 것.

실험 결과

연구 질문

  • RQ1동일한 SSL 모델을 사용함에도 불구하고 선형 프로빙 성능이 다양한 초매개변수 설정에 따라 크게 달라지는 이유는 무엇인가요?
  • RQ2특히 선형 헤드 이전의 배치 정규화를 통해 입력 정규화가 LP 및 k-NN 평가 지표의 안정성에 얼마나 기여하는가요?
  • RQ3SSL 사전학습 중 사용된 가중치 감소 초매개변수가 전이 학습 성능과 초매개변수 강건성에 어떻게 영향을 미치나요?
  • RQ4손실 곡면 분석을 통해 기존 훈련 곡선에서 드러나지 않는 일반화 및 강건성의 차이를 밝혀낼 수 있나요?
  • RQ5CKA로 측정한 피처 재사용성은 다양한 SSL 가중치 감소 설정 간 전이 가능성 향상과 관련이 있나요?

주요 결과

  • LP에서 선형 분류기 이전에 배치 정규화를 적용하면, 다양한 초매개변수 설정 간 성능 변동이 사라지고, LP와 k-NN 평가 지표 간의 일관성 문제도 해결됩니다.
  • SSL 가중치 감소 초매개변수가 하류 작업에서의 전이 가능성에 상당한 영향을 미치며, 0.04 → 0.2로 설정할 경우 가장 강건하고 일반화 능력이 뛰어난 표현을 생성합니다.
  • SSL 가중치 감소가 0.04 → 0.2로 설정된 모델들은 더 평탄한 손실 곡면을 보이며, 하류 초매개변수 선택에 대한 일반화 능력과 강건성이 향상됨을 시사합니다.
  • CKA 분석 결과, 0.04 → 0.2 가중치 감소로 사전학습된 모델의 표현은 미세조정 후 초기~중기 ViT 블록에서 더 높은 피처 재사용성을 보입니다.
  • 유사한 검증 손실 곡선을 보일지라도, SSL 가중치 감소가 높은 모델(0.04 → 0.4)은 더 빠른 수렴을 보이나 전이 성능은 열 劣하므로, 수렴 속도만으로는 전이 가능성의 신뢰도 있는 지표가 되지 못합니다.
  • 본 연구는 표준 평가 체계(LP 및 k-NN)가 SSL 가중치 감소가 하류 성능에 미치는 영향를 탐지하지 못하고 있음을 드러내며, 현재 평가 체계에 심각한 결함이 있음을 폭 드러냅니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.