Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Variational Transfer: Transfer Learning through Semi-supervised Deep Generative Models

Marouan Belhaj, Pavlos Protopapas|arXiv (Cornell University)|2018. 12. 07.
Domain Adaptation and Few-Shot Learning참고 문헌 23인용 수 4
한 줄 요약

이 논문은 깊이 있는 변동형 전이(DVT)를 제안하며, 동일한 클래스의 지도 학습 예제를 공유 잠재 가우시안 혼합 성분에 정렬하고, 비지도 타깃 데이터를 활용하여 공변량, 사전 및 조건부 이탈을 보정함으로써 이질적인 도메인 간 전이 학습을 가능하게 하는 준지도 학습 딥 생성 모델이다. DVT는 MNIST 준지도 학습에서 최상의 성능을 기록했으며, EROS, MACHO, HiTS와 같은 천체 과학 데이터셋에서 희귀 클래스의 F1 점수를 두 배로 높여 뚜렷한 성능 향상을 보였다.

ABSTRACT

In real-world applications, it is often expensive and time-consuming to obtain labeled examples. In such cases, knowledge transfer from related domains, where labels are abundant, could greatly reduce the need for extensive labeling efforts. In this scenario, transfer learning comes in hand. In this paper, we propose Deep Variational Transfer (DVT), a variational autoencoder that transfers knowledge across domains using a shared latent Gaussian mixture model. Thanks to the combination of a semi-supervised ELBO and parameters sharing across domains, we are able to simultaneously: (i) align all supervised examples of the same class into the same latent Gaussian Mixture component, independently from their domain; (ii) predict the class of unsupervised examples from different domains and use them to better model the occurring shifts. We perform tests on MNIST and USPS digits datasets, showing DVT's ability to perform transfer learning across heterogeneous datasets. Additionally, we present DVT's top classification performances on the MNIST semi-supervised learning challenge. We further validate DVT on a astronomical datasets. DVT achieves states-of-the-art classification performances, transferring knowledge across real stars surveys datasets, EROS, MACHO and HiTS, . In the worst performance, we double the achieved F1-score for rare classes. These experiments show DVT's ability to tackle all major challenges posed by transfer learning: different covariate distributions, different and highly imbalanced class distributions and different feature spaces.

연구 동기 및 목표

  • 제한된 레이블 데이터를 가진 실제 시나리오에서 공변량, 사전 및 조건부 이탈을 포함한 일반적인 데이터셋 이탈 상황에서 전이 학습의 과제를 해결한다.
  • 다양한 특징 공간과 균형 잡히지 않은 클래스 분포를 가진 고차원의 이질적 데이터를 다루지 못하는 기존 비지도 전이 학습 방법의 한계를 극복한다.
  • 공유 잠재 공간을 통해 지도 학습 및 비지도 학습 데이터를 동시에 모델링하여 레이블이 있는 소스 도메인에서 레이블이 없는 타깃 도메인으로 효과적인 지식 전이를 가능하게 한다.
  • 레이블이 없는 타깃 데이터를 활용하여 균형 잡히지 않은 데이터셋에서 희귀 클래스의 분류 성능을 향상시키고, 잠재 표현과 분류기 예측을 정교화한다.

제안 방법

  • 각 클래스가 고유한 GMM 성분에 매핑되는 공유 잠재 가우시안 혼합 모델(GMM)을 갖는 변동형 오토인코더 프레임워크를 제안하며, 이는 소스 및 타깃 도메인 간에 공유된다.
  • 재구성 손실, 사후분포와 사전분포 간의 KL 발산, 그리고 분류기 손실을 포함하는 준지도 추론 하한(lower bound, ELBO)을 사용하여 레이블이 있는 데이터와 레이블이 없는 데이터를 동시에 학습한다.
  • 에코더 및 분류기 네트워크에서 공유 파라미터를 통해 동일한 클래스의 지도 학습 예제가 서로 다른 도메인 간에 동일한 GMM 성분으로 정렬되도록 강제한다.
  • 잠재 표현 $ \boldsymbol{z} $ 에 기반한 도메인 전용 분류기 $ q_{\theta}(y|\boldsymbol{z}) $ 를 사용하여 레이블이 없는 타깃 데이터의 레이블을 예측하고, 이들가의 잠재 표현이 적절한 GMM 성분 쪽으로 매핑되도록 유도한다.
  • 이산 잠재 변수의 기울기 전파를 가능하게 하기 위해 Gumbel-Softmax 재구성과 재구성 기법을 적용하여 미분 가능한 학습을 실현한다.
  • 분류기 내의 argmax 연산을 통해 기울기를 역전파할 수 있도록 Gumbel-Softmax의 직렬 추정기(straight-through estimator)를 사용하여 전체 모델의 엔드 투 엔드 최적화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1다른 특징 공간, 공변량 이탈, 클래스 불균형을 가진 도메인 간에 준지도 학습 딥 생성 모델이 효과적으로 지식 전이를 수행할 수 있는가?
  • RQ2MNIST와 USPS와 같은 이질적 데이터셋 간에 동일한 클래스의 예제들이 공유 잠재 GMM 구조에 얼마나 잘 정렬되는가?
  • RQ3데이터셋 이탈 상황에서 레이블이 없는 타깃 데이터가 희귀 클래스의 분류 성능 향상에 얼마나 기여하는가?
  • RQ4제안된 방법이 준지도 학습 벤치마크와 실제 천체 과학 데이터셋에서 기존 최상의 방법들을 초월하는가?
  • RQ5모델은 다중 설문 천체 물체 분류와 같이 상당한 도메인 이탈이 존재하는 복잡하고 고차원적인 데이터에 대해 일반화 가능한가?

주요 결과

  • DVT는 MNIST 준지도 학습 벤치마크에서 최상의 성능을 기록하며, 레이블이 제한된 상황에서도 강력한 일반화 능력을 보였다.
  • 천체 과학 데이터셋(EROS, MACHO, HiTS)에서 DVT는 분류 성능을 크게 향상시켰으며, 기준 방법 대비 희귀 클래스의 최악의 F1 점수를 두 배로 높였다.
  • 공유 잠재 공간에서 레이블이 있는 데이터와 없는 데이터를 동시에 모델링함으로써 DVT는 공변량, 사전 및 조건부 이탈의 세 가지 유형을 효과적으로 다룰 수 있었다.
  • 동일한 클래스의 지도 학습 예제를 서로 다른 도메인 간에 동일한 GMM 성분에 정렬함으로써 DVT는 도메인 이탈의 영향을 줄이고, 새로운 타깃 도메인에 대한 제로샷 일반화 성능을 향상시켰다.
  • 레이블이 없는 타깃 데이터를 활용하여 잠재 공간의 클러스터링을 유도함으로써 모델의 강건성과 일반화 능력이 향상되었으며, 특히 데이터가 적거나 클래스가 불균형한 환경에서 두드러졌다.
  • Gumbel-Softmax 재구성 기법을 통해 이산 잠재 변수를 통해 효과적인 기울기 전파가 가능해져, 분류기 내 비미분 가능한 연산이 존재하더라도 전체 모델의 엔드 투 엔드 학습이 가능해졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.