Skip to main content
QUICK REVIEW

[논문 리뷰] Mine Your Own vieW: Self-Supervised Learning Through Across-Sample Prediction

Mehdi Azabou, Mohammad Gheshlaghi Azar|arXiv (Cornell University)|2021. 02. 19.
Domain Adaptation and Few-Shot Learning참고 문헌 60인용 수 13
한 줄 요약

Mine Your Own vieW (MYOW)는 데이터 증강에만 의존하는 것 대신, 데이터셋의 근접한 이웃을 긍정적 시각으로 사용함으로써 표현 학습을 향상시키는 자기지도 학습 방법이다. 이는 증강된 시각과 미네랄된 시각 양쪽 모두에서 표현을 예측하는 계단식 이중 프로젝터 아키텍처를 사용하며, 이미지 벤치마크에서 최고 성능을 기록하고 뇌 신호 기록에 대한 신경과학 적용에서 지도 학습 기반 모델을 능가한다.

ABSTRACT

State-of-the-art methods for self-supervised learning (SSL) build representations by maximizing the similarity between different transformed "views" of a sample. Without sufficient diversity in the transformations used to create views, however, it can be difficult to overcome nuisance variables in the data and build rich representations. This motivates the use of the dataset itself to find similar, yet distinct, samples to serve as views for one another. In this paper, we introduce Mine Your Own vieW (MYOW), a new approach for self-supervised learning that looks within the dataset to define diverse targets for prediction. The idea behind our approach is to actively mine views, finding samples that are neighbors in the representation space of the network, and then predict, from one sample's latent representation, the representation of a nearby sample. After showing the promise of MYOW on benchmarks used in computer vision, we highlight the power of this idea in a novel application in neuroscience where SSL has yet to be applied. When tested on multi-unit neural recordings, we find that MYOW outperforms other self-supervised approaches in all examples (in some cases by more than 10%), and often surpasses the supervised baseline. With MYOW, we show that it is possible to harness the diversity of the data to build rich views and leverage self-supervision in new domains where augmentations are limited or unknown.

연구 동기 및 목표

  • 자기지도 학습(SSL)에서 고정된 데이터 증강 기법의 한계를 해결하기 위해, 이는 의미적 다양성을 충분히 포괄하거나 도메인 간 일반화를 충분히 보장하지 못할 수 있음.
  • 대표 공간의 근접성에 기반해 데이터셋에서 직접 다양한 의미적 시각을 미네랄 수 있는지 탐색함.
  • 부정 예제가 필요 없이 증강된 시각과 미네랄된 시각을 모두 통합하는 통합된 SSL 프레임워크를 개발함.
  • 효과적인 데이터 증강이 알려져 있거나 제한된 신경과학 분야에 자기지도 학습을 확장함.
  • 표본 간 최근접 이웃 예측이 표준 대비 대비나 인스턴스 수준의 SSL 방법보다 더 강력한 표현을 도출할 수 있는지 입증함.

제안 방법

  • 계단식 이중 프로젝터 아키텍처를 도입함: 첫 번째 프로젝터는 동일한 샘플의 증강된 시각을 예측하도록 학습하고, 두 번째 프로젝터는 잠재 공간 내에서 근접한 샘플의 표현을 예측함.
  • 미네랄된 시각은 앵커 샘플의 온라인 네트워크 표현과 타겟 네트워크의 후보자원에서의 표현 간 k-최근접 이웃(k-NN)을 계산하여 선택함.
  • 두 번째 프로젝터는 첫 번째의 출력에서 유래하므로, 의미적으로 유사하지만 서로 다른 샘플의 표현을 예측하도록 모델이 학습할 수 있음.
  • BYOL에 기반한 프레임워크로, 부정 예제가 필요 없고 학습 동역학을 단순화함.
  • 비인간 영장류, 쥐, 쥐 등 다양한 종의 뇌 신호 기록에 대해 통합된 시간적 및 공간적 증강 기법을 적용하여 일관된 사전학습을 가능하게 함.
  • 국소적(시간적) 및 비국소적(표본 간) 예측을 모두 활용하여 장거리 의존성과 richer 표현을 포착함.

실험 결과

연구 질문

  • RQ1대표 공간 내에서 최근접 이웃 샘플이 자기지도 학습에 효과적이고 다양한 긍정적 시각으로 기능할 수 있는가?
  • RQ2표준 데이터 증강 기법과 비교해 데이터셋에서 미네랄된 시각을 사용할 경우 표현 품질은 어떻게 달라지는가?
  • RQ3효과적인 증강 기법이 알려져 있거나 제한된 도메인, 예를 들어 뇌 신호 기록에 대해 MYOW는 일반화 가능한가?
  • RQ4신경과학 적용에서 표준 인스턴스 수준 또는 대비 SSL 방법에 비해 표본 간 예측이 성능 향상에 기여하는가?
  • RQ5MYOW를 사용한 자기지도 학습이 뇌 복원 작업에서 지도 학습 기반 모델을 능가할 수 있는가?

주요 결과

  • CIFAR-10, CIFAR-100, Tiny ImageNet에서 MYOW는 BYOL 및 SimCLR와 같은 최고 수준의 방법들과 경쟁하거나 그들을 능가하는 성능을 기록함.
  • 뇌 복원 작업에서 MYOW는 일부 뇌 기록 데이터셋에서 다른 자기지도 학습 방법보다 10퍼센트 이상 높은 성능을 보였으며, 운동 피질에서의 운동 예측 및 V1 및 해마에서의 수면 단계 분류에 적용됨.
  • 뇌 데이터셋에서 MYOW는 드롭아웃과 가중치 감쇠를 적용한 지도 학습 기반 모델을 항상 능가함으로써, 레이블이 없는 데이터로도 강력한 일반화 능력을 보임.
  • 대표 공간 내에서 k-NN를 활용한 비국소적, 표본 간 예측이 국소적 시간적 예측만으로는 성능 향상이 크게 부족함을 입증함.
  • 시간적 및 공간적 증강 기법과 함께 미네랄된 시각을 통합하는 것이 뇌 상태의 의미 있는 표현을 학습하는 데 필수적임.
  • MYOW는 단일 뉴런 수준에서 다중 유닛 뇌 신호 기록에 자기지도 학습을 적용한 최초의 사례를 확립하며, 뇌 신호 분석의 새로운 길을 열어줌.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.