Skip to main content
QUICK REVIEW

[논문 리뷰] Representation Uncertainty in Self-Supervised Learning as Variational Inference

Hiroki Nakamura, Masashi Okada|arXiv (Cornell University)|2022. 03. 22.
Domain Adaptation and Few-Shot Learning인용 수 4
한 줄 요약

이 논문은 자율학습(SSL)의 새로운 방법인 VI-SimSiam을 제안하며, SimSiam을 강력한 구면 잠재 공간 위에서의 변분 추론으로 재해석함으로써 레이블 없이도 불확실성 인식 표현 학습이 가능하도록 한다. 표현을 확률적으로 모델링함으로써 VI-SimSiam은 특징뿐만 아니라 농도 매개변수 κ를 통한 불확실성까지 예측하며, 경쟁력 있는 정확도를 달성하면서도 낮은 κ가 모호하거나 저소실도 이미지와 질적으로 연관됨을 보여준다.

ABSTRACT

In this study, a novel self-supervised learning (SSL) method is proposed, which considers SSL in terms of variational inference to learn not only representation but also representation uncertainties. SSL is a method of learning representations without labels by maximizing the similarity between image representations of different augmented views of an image. Meanwhile, variational autoencoder (VAE) is an unsupervised representation learning method that trains a probabilistic generative model with variational inference. Both VAE and SSL can learn representations without labels, but their relationship has not been investigated in the past. Herein, the theoretical relationship between SSL and variational inference has been clarified. Furthermore, a novel method, namely variational inference SimSiam (VI-SimSiam), has been proposed. VI-SimSiam can predict the representation uncertainty by interpreting SimSiam with variational inference and defining the latent space distribution. The present experiments qualitatively show that VI- SimSiam could learn uncertainty by comparing input images and predicted uncertainties. Additionally, we described a relationship between estimated uncertainty and classification accuracy.

연구 동기 및 목표

  • 자기주도학습(SSL)과 변분 추론 사이의 이론적 연결 고리를 확립하고, 특히 SimSiam와 같은 비대비 SSL 방법에 초점을 맞춘다.
  • 기존 SSL 프레임워크에서 불확실성 추정이 부족한 점을 보완하기 위해, 표현뿐만 아니라 그 불확실성까지 자기주도적으로 학습하는 방법을 개발한다.
  • 불확실성 추정치(κ)가 다운스트림 분류 정확도와 이미지의 주목도와 상관관계가 있음을 입증함으로써 모델의 해석 가능성 향상.
  • SimSiam, SimCLR, DINO를 동일한 변분 추론 프레임워크로 통합하여, 이들의 잠재 확률적 구조를 드러낸다.

제안 방법

  • 잠재 표현을 강력한 구면 분포로 모델링함으로써 SimSiam을 변분 추론으로 해석하여 농도 매개변수 κ를 통한 불확실성 추정이 가능하도록 한다.
  • SSL 목표함수를 증거 하한 경계(ELBO)로 제시하며, 정렬(기여도 J_align), 균일성(기여도 J_uniform), KL 발산(기여도 J_KL)의 세 가지 성분을 포함하여 사후분포를 정규화한다.
  • 사후분포 p(z|x,θ)는 단일 모odal 사후분포의 전문가 제품(Product-of-Experts, PoE)으로 모델링되며, 근사 사후분포 q(z|x,φ)는 다중 증거의 혼합(Mixture-of-Experts, MoE)으로 구성되어 다중 증거 일致성 확보.
  • 표현의 불확실성은 강력한 구면 분포의 농도 매개변수 κ를 통해 표현되며, 이는 학습 중 공동 최적화된다.
  • 강력한 구면 분포의 로그 정규화 상수에 대한 미분 가능한 근사치를 사용하여 엔드 투 엔드 학습이 가능하도록 한다.
  • 이 프레임워크는 기존 SSL 방법을 일반화한다: SimSiam는 초구면 위에 균일한 사전분포를 가진 결정론적 출력으로, SimCLR는 이산적 출력으로, DINO는 모멘텀 인코더를 갖춘 결정론적 변형으로 표현된다.

실험 결과

연구 질문

  • RQ1SimSiam와 같은 자기주도학습 방법을 변분 추론의 관점에서 해석할 수 있는가?
  • RQ2레이블이 없는 자기주도 설정에서 표현의 불확실성을 명시적으로 모델링하고 예측할 수 있는가?
  • RQ3추정된 불확실성(κ)과 모델의 다운스트림 분류 성능 사이의 관계는 무엇인가?
  • RQ4잠재공간 분포(예: 강력한 구면, 바흐-미제-피셔 분포)는 어떻게 다양한 SSL 목표함수를 동일한 확률적 프레임워크로 통합하는가?

주요 결과

  • VI-SimSiam는 레이블 없이도 표현의 불확실성을 성공적으로 학습하며, 낮은 불확실성(높은 κ)은 더 주목도가 높거나 잘 구성된 이미지와 관련이 있다.
  • 불확실성 매개변수 κ는 이미지 콘텐츠와 질적으로 연관된다: 주목도가 낮거나 모호한 특징을 가진 이미지는 낮은 κ 값을 보이며, 이는 높은 불확실성을 의미한다.
  • ImageNet-1K에서 선형 평가 정확도가 표준 SimSiam와 유사한 수준을 기록하여, 불확실성 학습이 성능에 악영향을 주지 않음을 입증한다.
  • 추정된 불확실성(κ)과 분류 정확도 사이에 양의 상관관계가 관찰되어, 높은 불확실성 예측이 더 확신 있고 정확한 예측과 관련이 있음을 시사한다.
  • 이론적 프레임워크는 SimSiam, SimCLR, DINO를 모두 변분 추론의 특수한 경우로 통합하며, VI-SimSiam는 SimSiam에 불확실성 추정 기능을 확장한 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.