Skip to main content
QUICK REVIEW

[논문 리뷰] Supermasks in Superposition

Mitchell Wortsman, Vivek Ramanujan|arXiv (Cornell University)|2020. 06. 26.
Domain Adaptation and Few-Shot Learning참고 문헌 51인용 수 8
한 줄 요약

Supermasks in Superposition (SupSup)는 고정된 무작위로 초기화된 신경망을 사용하고 각 작업에 대해 작업별 하위망(초과마스크)를 학습하여 수천 개의 작업에 대한 지속적 학습을 가능하게 하며, 치명적인 잊음 없이 학습한다. 작업 정체성을 기울기 기반 최적화를 통해 선형 초과마스크의 초합으로 추론하며, 2500개의 작업을 포함해 단일 기울기 단계로도 정확한 추론을 달성한다. 이와 함께 제로샷 작업 탐지와 일정 크기의 메모리 지원을 위해 호프필드 네트워크 저장소를 활용한다.

ABSTRACT

We present the Supermasks in Superposition (SupSup) model, capable of sequentially learning thousands of tasks without catastrophic forgetting. Our approach uses a randomly initialized, fixed base network and for each task finds a subnetwork (supermask) that achieves good performance. If task identity is given at test time, the correct subnetwork can be retrieved with minimal memory usage. If not provided, SupSup can infer the task using gradient-based optimization to find a linear superposition of learned supermasks which minimizes the output entropy. In practice we find that a single gradient step is often sufficient to identify the correct mask, even among 2500 tasks. We also showcase two promising extensions. First, SupSup models can be trained entirely without task identity information, as they may detect when they are uncertain about new data and allocate an additional supermask for the new training distribution. Finally the entire, growing set of supermasks can be stored in a constant-sized reservoir by implicitly storing them as attractors in a fixed-sized Hopfield network.

연구 동기 및 목표

  • 미사전훈련된 무작위 가중치를 가진 하위망을 활용하여 지속적 학습에서 치명적인 잊음을 해결하기 위해.
  • 테스트 시 작업 정체성이 제공되지 않은 상황에서도 초과마스크 조합의 기울기 기반 최적화를 통해 정확한 작업 추론을 가능하게 하기 위해.
  • 최소한의 메모리 오버헤드로 수천 개의 작업에 대한 지속적 학습을 스케일링하기 위해.
  • 사전 정의된 정체성 없이도 새로운 작업을 제로샷으로 탐지할 수 있도록 하기 위해.
  • 고정된 크기의 호프필드 네트워크 저장소를 사용하여 증가하는 초과마스크 집합을 효율적으로 저장하기 위해.

제안 방법

  • 기본 신경망을 고정된 상태로 유지하고 각 작업에 대해 고유한 이진 초과마스크를 학습하여 하위망을 구성한다.
  • 테스트 시점에서 출력 엔트로피를 최소화하도록 학습된 초과마스크의 볼록 조합을 최적화하여 작업 정체성을 추론한다.
  • MNIST의 최대 2500개의 순열 중에서 정확한 작업을 식별하기 위해 단일 기울기 단계를 사용한다.
  • 학습 중에 작업 정체성이 없을 경우 불확실성을 감지하고 새로운 초과마스크를 할당하는 메커니즘을 도입한다.
  • 초과마스크를 안정점으로 간주하여 고정된 크기의 메모리에 암묵적으로 저장하기 위해 호프필드 네트워크 저장소를 구현한다.
  • 작업 정체성 가용성에 따라 다양한 상황을 체계적으로 평가하기 위해 3자리 암호(예: GG, GN, NNs)를 사용한다.

실험 결과

연구 질문

  • RQ1고정된 무작위로 초기화된 네트워크가 치명적인 잊음을 겪지 않고 수천 개의 작업을 학습할 수 있는가?
  • RQ2테스트 시점에서 명시적 감독 없이 초과마스크 조합의 기울기 기반 최적화만으로 정확한 작업 정체성을 추론할 수 있는가?
  • RQ3사전 작업 정체성 정보 없이도 새로운, 알려지지 않은 작업 분포를 감지하고 적응할 수 있는가?
  • RQ4호프필드 네트워크 저장소를 사용하여 모든 학습된 초과마스크를 고정된 크기의 메모리에 암묵적으로 저장할 수 있는가?
  • RQ5초과마스크의 희박성과 네트워크의 과잉 파rameter화가 추론 정확도와 강건성에 어떤 영향을 미치는가?

주요 결과

  • SupSup는 GG 시나리오에서 최근 기준보다 더 낮은 저장소와 훈련 시간으로 SplitImageNet에서 최고 성능을 기록한다.
  • GN 시나리오에서 SupSup는 단일 기울기 단계만으로 2500개의 MNIST 순열에 걸쳐 높은 정확도를 유지하며 잊음 없이 학습한다.
  • NNs 시나리오에서 SupSup는 불확실성 감지와 자동으로 새로운 초과마스크 할당을 통해 새로운 작업을 성공적으로 탐지한다.
  • 과잉 노드가 존재하더라도 정확한 작업 추론이 가능하며, 이는 분포 이탈에 대한 강건성을 향상시킨다.
  • 호프필드 네트워크 저장소를 통해 모든 초과마스크가 고정 크기의 메모리에 암묵적으로 저장되며, 전체 모델 용량을 유지한다.
  • 실험 결과, 출력 엔트로피 최소화를 위한 기울기 최적화가 고차원 작업 공간에서도 정확한 초과마스크를 신속하게 식별하는 데에 신뢰할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.