Skip to main content
QUICK REVIEW

[논문 리뷰] HyperTransformer: Model Generation for Supervised and Semi-Supervised Few-Shot Learning

Andrey Zhmoginov, M. Sandler|arXiv (Cornell University)|2022. 01. 11.
Domain Adaptation and Few-Shot Learning인용 수 18
한 줄 요약

HyperTransformer는 소형 합성곱 신경망(CNN)의 모든 가중치를 소수의 지원 세트로부터 직접 생성하는 Transformer 기반 모델을 제안한다. 이는 타겟 모델의 복잡성과 작업 특화 복잡성을 분리한다. 이는 소수의 샘플에서의 성능을 개선하고, 특히 소형 CNN에서 최신 기술을 초월하며, 라벨이 없는 데이터를 포함한 준지도 학습으로 자연스럽게 확장된다. 이는 모든 레이어나 단지 최종 로짓 레이어만 생성함으로써 가능하다.

ABSTRACT

In this work we propose a HyperTransformer, a Transformer-based model for supervised and semi-supervised few-shot learning that generates weights of a convolutional neural network (CNN) directly from support samples. Since the dependence of a small generated CNN model on a specific task is encoded by a high-capacity Transformer model, we effectively decouple the complexity of the large task space from the complexity of individual tasks. Our method is particularly effective for small target CNN architectures where learning a fixed universal task-independent embedding is not optimal and better performance is attained when the information about the task can modulate all model parameters. For larger models we discover that generating the last layer alone allows us to produce competitive or better results than those obtained with state-of-the-art methods while being end-to-end differentiable.

연구 동기 및 목표

  • 고정된 보편적 임bedding 또는 제한된 파라미터 업데이트에 의존하는 메트릭 기반 및 최적화 기반 소수의 샘플 학습 방법의 한계를 해결한다.
  • 고성능 Transformer를 사용해 작업 특화 CNN 가중치를 생성함으로써 작업 공간의 복잡성을 개별 모델에서 분리한다.
  • 중첩된 기울기 또는 복잡한 최적화 기법 없이도 소수의 샘플 학습을 위한 엔드 투 엔드 미분 가능 학습을 가능하게 한다.
  • 라벨이 없는 샘플을 지원 세트에 포함시켜 준지도 학습 소수의 샘플 학습으로 이 프레임워크를 확장한다.
  • 모델 크기와 작업 복잡성에 따라 모든 CNN 레이어를 생성하는 것과 최종 로짓 레이어만 생성하는 것 사이의 성능 상충 관계를 조사한다.

제안 방법

  • 지원 세트 이미지와 레이블을 입력으로 받아 단일 순방향 전파에서 모든 CNN 가중치를 생성하는 Transformer 기반의 가중치 생성기 사용.
  • 변동 크기의 지원 세트를 처리하고 클래스 불균형을 다루기 위해 자기주의 기반 메커니즘을 활용하며, 위치 인코딩이나 마스킹 없이 작동한다.
  • 생성된 CNN 가중치를 사용해 쿼리 세트에서 교차 엔트로피 손실을 최소화하도록 HyperTransformer를 엔드 투 엔드로 훈련한다.
  • 지원 세트에 특수 토큰을 추가해 라벨이 없는 예시를 포함함으로써 준지도 학습을 지원한다.
  • 유연한 아키텍처 설계를 허용: 더 큰 모델의 경우 최종 로짓 레이어만 생성하거나, 더 작은 모델의 경우 모든 합성곱 레이어를 생성한다.
  • UMAP를 사용해 다양한 클래스 간에 생성된 CNN 가중치의 의미적 군집화를 시각화함으로써, 가중치 생성 과정에서 의미 정보가 포함되어 있음을 나타낸다.

실험 결과

연구 질문

  • RQ1소수의 샘플 지원 세트로부터 직접 Transformer 기반 모델이 소형 CNN의 모든 가중치를 효과적으로 생성할 수 있는가? 이는 소수의 샘플 일반화 성능을 향상시키는가?
  • RQ2최종 로짓 레이어만 생성하는 것보다 모든 합성곱 레이어를 생성하는 것이 소형 모델에서 더 높은 성능을 내는가?
  • RQ3지원 세트에 라벨이 없는 샘플을 포함시키면 소수의 샘플 성능에 어떤 영향을 미치며, Transformer의 깊이가 이를 활용하는 데 어떤 역할을 하는가?
  • RQ4정적 CNN 백본을 사용하는 것과 HyperTransformer를 통해 모든 모델 파라미터를 생성하는 것 사이의 성능 상충 관계는 어떠한가?
  • RQ5모델 크기의 기준이 무엇인지, 최종 레이어만 생성하는 것이 충분한 모델 크기의 임계점은 어디이며, 이를 결정짓는 요소는 무엇인가?

주요 결과

  • HyperTransformer는 MAML++ 및 RFS보다 소형 CNN(예: 4채널 및 6채널 모델)에서 모든 합성곱 레이어와 최종 로짓 레이어를 생성함으로써 우수한 성능을 기록한다.
  • 더 큰 모델(예: 8채널 이상)에서는 최종 로짓 레이어만 생성하는 것이 최고 성능에 도달하며, 최신 기술과 유사한 성능을 기록함으로써 중간 레이어를 생성하는 데서는 수익 감소 현상이 나타남을 시사한다.
  • 라벨이 없는 샘플을 포함시킴으로써 성능 향상이 뚜렷하게 향상되며, 특히 Transformer가 두 개 이상의 레이어일 경우, 최근접 이웃 방식의 일반화가 가능해진다.
  • 두 레이어의 Transformer는 최근접 이웃 알고리즘을 인코딩할 수 있어, 명시적 최적화 목표 없이도 라벨이 있는 예제와 유사한 라벨이 없는 예제를 연결할 수 있다.
  • UMAP를 활용한 시각화 결과, 생성된 CNN 가중치가 클래스별로 군집되어 있음을 확인하여, 의미 정보가 가중치 생성 과정에 포함되어 있음을 나타낸다.
  • 큰 커널과 스트라이드(예: 9x9, 스트라이드 4)를 가진 모델에서는 최종 로짓 레이어 외에 최소한 하나의 추가 합성곱 레이어를 생성함으로써, 최종 레이어만 생성하는 것보다 테스트 정확도가 약 1% 향상된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.