Skip to main content
QUICK REVIEW

[논문 리뷰] Self-Supervised Learning via Maximum Entropy Coding

Xin Liu, Zhongdao Wang|arXiv (Cornell University)|2022. 10. 20.
Domain Adaptation and Few-Shot Learning인용 수 14
한 줄 요약

이 논문은 최대 엔트로피 부호화(MEC)를 제안하며, 최소 부호 길이를 계산 가능하게 하는 대체 척도로 사용하여 표현 일반화를 명시적으로 최적화하는 자기지도 학습 방법이다. MEC는 이미지 분류, 객체 검출, 세분화, 추적과 같은 다양한 후행 작업에서 인스턴스 식별과 같은 편향된 사전 작업에 의존하지 않고도 최첨단 성능을 달성한다.

ABSTRACT

A mainstream type of current self-supervised learning methods pursues a general-purpose representation that can be well transferred to downstream tasks, typically by optimizing on a given pretext task such as instance discrimination. In this work, we argue that existing pretext tasks inevitably introduce biases into the learned representation, which in turn leads to biased transfer performance on various downstream tasks. To cope with this issue, we propose Maximum Entropy Coding (MEC), a more principled objective that explicitly optimizes on the structure of the representation, so that the learned representation is less biased and thus generalizes better to unseen downstream tasks. Inspired by the principle of maximum entropy in information theory, we hypothesize that a generalizable representation should be the one that admits the maximum entropy among all plausible representations. To make the objective end-to-end trainable, we propose to leverage the minimal coding length in lossy data coding as a computationally tractable surrogate for the entropy, and further derive a scalable reformulation of the objective that allows fast computation. Extensive experiments demonstrate that MEC learns a more generalizable representation than previous methods based on specific pretext tasks. It achieves state-of-the-art performance consistently on various downstream tasks, including not only ImageNet linear probe, but also semi-supervised classification, object detection, instance segmentation, and object tracking. Interestingly, we show that existing batch-wise and feature-wise self-supervised objectives could be seen equivalent to low-order approximations of MEC. Code and pre-trained models are available at https://github.com/xinliu20/MEC.

연구 동기 및 목표

  • 기존 자기지도 사전 작업에서 발생하는 본질적 편향이 다양한 후행 작업으로의 일반화를 제한하는 문제를 해결하기 위해.
  • 표현의 구조를 직접 최적화하는 원칙적인 일반 목적의 표현 학습 목표를 개발하기 위해.
  • 손실 부호화를 통한 정보 이론에 기반한 최대 엔트로피에 기반한 통합 목표로 히وري스틱한 사전 작업을 대체하기 위해.
  • 대규모 사전 학습을 위한 확장 가능한 계산 환경에서 엔드 투 엔드 학습을 가능하게 하기 위해.
  • 기존의 배치 기반 및 특징 기반 SSL 방법들을 공통 이론적 프레임워크로 통합하기 위해.

제안 방법

  • 학습된 표현의 엔트로피를 최대화하는 새로운 자기지도 학습 목표로 최대 엔트로피 부호화(MEC)를 제안한다.
  • 손실 부호화에서의 최소 부호 길이를 엔트로피 추정의 계산 가능하게 하는 대체 척도로 사용한다.
  • 부호 길이의 로그 행렬식 항을 근사하기 위해 테일러 전개를 적용하여 빠르고 확장 가능한 계산을 가능하게 한다.
  • 대규모 사전 학습에 적합한 미분 가능하고 확장 가능한 형태로 목표를 재구성한다.
  • 시아미즈 표현 학습에서 유도된 뷰 일致성 사전 지식을 표현의 구조적 인덕티브 바이어스로 활용한다.
  • MEC의 저차수 근사가 기존 방법들인 SimSiam 및 Barlow Twins와 수학적으로 동일하다는 것을 입증한다.

실험 결과

연구 질문

  • RQ1표현 엔트로피를 명시적으로 최대화하는 것이 다양한 후행 시각 작업으로의 일반화에 더 나은 성능을 이끌 수 있는가?
  • RQ2표현의 구조를 측정하는 엔트로피는 자기지도 학습에서 효율적으로 최적화될 수 있는가?
  • RQ3MEC와 기존의 배치 기반 또는 특징 기반 SSL 목표 간의 이론적 관계는 무엇인가?
  • RQ4MEC는 SimSiam 및 SimCLR와 같은 강력한 베이스라인을 다양한 데이터 분포와 작업 유형에서 초월할 수 있는가?
  • RQ5MEC는 음성 마이닝, 메모리 큐, 클러스터링 구성 요소 없이도 자연스럽게 모드 붕괴를 방지할 수 있는가?

주요 결과

  • MEC는 ImageNet 선형 프로빙에서 이전 자기지도 학습 방법들을 능가하는 최첨단 성능을 달성한다.
  • MEC는 이미지 분류, 객체 검출, 인스턴스 세분화, 영상 객체 추적과 같은 다양한 후행 작업에서 일관된 일반화 성능을 보인다.
  • MEC는 도메인 외 일반화, 특히 알려지지 않은 ImageNet 카테고리로의 제로샷 전이에서도 뛰어난 성능을 보인다.
  • MEC의 저차수 근사는 SimSiam 및 Barlow Twins와 같은 기존 방법들과 수학적으로 동일하며, 통합적 시각을 제공한다.
  • MEC는 인스턴스 식별, 메모리 큐, 온라인 클러스터링을 필요로 하지 않으면서도 강력한 성능을 유지한다.
  • MEC는 SimCLR 및 SimSiam와 같은 기존 SSL 프레임워크에 원활하게 통합되어 일관된 성능 향상을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.