Skip to main content
QUICK REVIEW

[논문 리뷰] Self-Supervised Learning with Kernel Dependence Maximization

Yazhe Li, Roman Pogodin|arXiv (Cornell University)|2021. 06. 15.
Domain Adaptation and Few-Shot Learning참고 문헌 69인용 수 21
한 줄 요약

이 논문은 자기지도학습 방법인 SSL-HSIC를 제안하며, 힐버트-스미스터 독립성 기준(Hilbert-Schmidt Independence Criterion, HSIC)을 사용해 이미지의 증강된 뷰와 그 정체성 간의 통계적 종속성을 최대화하면서 표현의 분산을 최소화한다. 이는 ImageNet에서 선형 평가 정확도 74.8%의 최상위 성능을 달성하며, InfoNCE나 BYOL을 능가하거나 견줄 만큼의 성능을 보이며, 상관관계 최대화의 통합적 시각을 제공한다. 이는 상호정보량 추정기나 음성 페어(mining)에 의존하지 않는다.

ABSTRACT

We approach self-supervised learning of image representations from a statistical dependence perspective, proposing Self-Supervised Learning with the Hilbert-Schmidt Independence Criterion (SSL-HSIC). SSL-HSIC maximizes dependence between representations of transformations of an image and the image identity, while minimizing the kernelized variance of those representations. This framework yields a new understanding of InfoNCE, a variational lower bound on the mutual information (MI) between different transformations. While the MI itself is known to have pathologies which can result in learning meaningless representations, its bound is much better behaved: we show that it implicitly approximates SSL-HSIC (with a slightly different regularizer). Our approach also gives us insight into BYOL, a negative-free SSL method, since SSL-HSIC similarly learns local neighborhoods of samples. SSL-HSIC allows us to directly optimize statistical dependence in time linear in the batch size, without restrictive data assumptions or indirect mutual information estimators. Trained with or without a target network, SSL-HSIC matches the current state-of-the-art for standard linear evaluation on ImageNet, semi-supervised learning and transfer to other classification and vision tasks such as semantic segmentation, depth estimation and object recognition. Code is available at https://github.com/deepmind/ssl_hsic .

연구 동기 및 목표

  • 상호정보량이 아닌 통계적 종속성에 기반한 원리적인 자기지도학습 프레임워크를 개발하는 것.
  • 대조학습, InfoNCE, BYOL을 통계적 종속성 최대화의 공통적 관점에서 통합하는 것.
  • 음성 페어나 타겟 네트워크에 의존하지 않으면서도, 명시적 분산 정규화를 통해 붕괴를 방지하는 것.
  • 랜덤 푸리에 특징을 사용해 종속성의 선형 시간 계산을 효율적으로 수행하는 것.
  • 선형 평가, 전이 학습, 최종 비전 작업에서 최신 성능을 달성하는 것.

제안 방법

  • 증강된 뷰의 표현과 이미지 정체성 간의 HSIC를 최대화하고 표현의 커널 기반 분산을 최소화하는 손실인 SSL-HSIC를 제안한다.
  • 뷰와 정체성 간의 통계적 종속성 측정으로 힐버트-스미스터 독립성 기준(HSIC)을 비모수적 측정으로 사용한다.
  • 배치 크기와 선형 시간 복잡도로 HSIC 커널을 근사하기 위해 랜덤 푸리에 특징(RFF)을 활용한다.
  • 비어 있는 해를 방지하기 위한 분산 기반 정규화 항을 도입하여 타겟 네트워크의 필요성을 제거한다.
  • InfoNCE와 SSL-HSIC 간의 유사성을 유도하며, InfoNCE가 다른 정규화 항을 사용해 SSL-HSIC를 암묵적으로 근사함을 보여준다.
  • 타겟 네트워크 유무에 관계없이 방법을 적용하며, 사용 시 성능 향상을 입증한다.

실험 결과

연구 질문

  • RQ1HSIC를 통한 통계적 종속성 최대화가 상호정보량 최대화의 원리적인 대안이 될 수 있는가?
  • RQ2SSL-HSIC는 InfoNCE나 BYOL과 같은 기존의 대조학습 방법과 어떻게 관련이 있는가?
  • RQ3종속성 기반 목표함수는 음성 페어나 타겟 네트워크가 필요 없도록 만들 수 있는가?
  • RQ4HSIC 기반 최적화는 상호정보량 기반 경계보다 더 나은 최종 성능을 낼 수 있는가?
  • RQ5랜덤 푸리에 특징을 사용해 HSIC를 선형 시간 내에 효율적으로 계산할 수 있는가?

주요 결과

  • 선형 평가를 통해 ImageNet에서 SSL-HSIC는 상위-1 정확도 74.8%와 상위-5 정확도 92.2%를 달성하며, 최신 기준에 부합한다.
  • 표준 선형 평가 벤치마크에서 InfoNCE, BYOL, SimCLR, MoCo v2, SwAV, Barlow Twins를 능가하거나 견줄 수 있다.
  • 세미-지도 학습 및 전이 학습에서, 의미 분할, 깊이 추정, 객체 인식 등의 작업에서 성능이 유사하거나 뛰어나다.
  • InfoNCE가 다른 정규화 항을 사용해 SSL-HSIC를 암묵적으로 근사함을 입증하며, 이는 상호정보량 추정의 문제점에도 불구하고 성공을 설명한다.
  • 명시적 분산 정규화 덕분에 타겟 네트워크 없이도 강인한 성능을 보이며, 타겟 네트워크를 사용할 경우 성능이 향상된다.
  • 랜덤 푸리에 특징의 사용으로 HSIC의 효율적이고 선형 시간 계산이 가능해져 배치 크기에 따라 잘 스케일링된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.