Skip to main content
QUICK REVIEW

[논문 리뷰] Stochastic Prototype Embeddings

Tyler R. Scott, Karl Ridgeway|arXiv (Cornell University)|2019. 09. 25.
Domain Adaptation and Few-Shot Learning참고 문헌 27인용 수 10
한 줄 요약

이 논문은 소수 샘플 학습에서 불확실성을 포착하기 위해 임베딩을 가우시안 랜덤 변수로 모델링하는 확률적 확장인 Stochastic Prototype Embeddings (SPE)를 제안한다. 효율적인 샘플러를 통해 임베딩 불확실성을 적분함으로써, SPE는 레이블 노이즈와 분포 외 입력에 대해 더 강건하며, 소수 샘플 및 오픈세트 분류에서 결정론적(PN) 및 확률적(HIB) 기준보다 우수한 성능을 보이며, 해석 가능하고 분리된 표현을 제공한다.

ABSTRACT

Supervised deep-embedding methods project inputs of a domain to a representational space in which same-class instances lie near one another and different-class instances lie far apart. We propose a probabilistic method that treats embeddings as random variables. Extending a state-of-the-art deterministic method, Prototypical Networks (Snell et al., 2017), our approach supposes the existence of a class prototype around which class instances are Gaussian distributed. The prototype posterior is a product distribution over labeled instances, and query instances are classified by marginalizing relative prototype proximity over embedding uncertainty. We describe an efficient sampler for approximate inference that allows us to train the model at roughly the same space and time cost as its deterministic sibling. Incorporating uncertainty improves performance on few-shot learning and gracefully handles label noise and out-of-distribution inputs. Compared to the state-of-the-art stochastic method, Hedged Instance Embeddings (Oh et al., 2019), we achieve superior large- and open-set classification accuracy. Our method also aligns class-discriminating features with the axes of the embedding space, yielding an interpretable, disentangled representation.

연구 동기 및 목표

  • 레이블 노이즈, 데이터 손상, 분포 외 입력으로 인한 불확실성 처리에 어려움을 겪는 결정론적 딥 임베딩 방법의 한계를 해결하기 위해.
  • 학습 효율성을 유지하면서도 소수 샘플 및 오픈세트 학습 시나리오에서 일반화 성능을 향상시키는 확률적 임베딩 방법을 개발하기 위해.
  • 임베딩 공간의 주축과 클래스 구분 특징을 정렬함으로써, 해석 가능하고 분리된 표현을 가능하게 하기 위해.
  • 대규모 세트 및 오픈세트 분류 작업에서 Hedged Instance Embeddings(HIB)와 같은 최신 확률적 방법을 능가하는 성능을 내기 위해.
  • 조정 가능한 불확실성 모델링을 제공하는 기존 확률적 임베딩 프레임워크의 스케일러블하고 파라미터 없는 대안을 제공하기 위해.

제안 방법

  • SPE는 각 클래스 프로토타입을 가우시안 랜덤 변수로 모델링하며, 인스턴스 임베딩은 이를 중심으로 산점하는 i.i.d. 가우시안 편향으로 분포한다.
  • 질의 분류를 위해 프로토타입 근접도에 대한 적분을 수행함으로써, 지원 및 질의 임베딩 양쪽의 불확실성을 통합한다.
  • 효율적인 근사 사후 추론을 위해 교차 샘플러를 도입하였으며, 이는 거의 결정론적 계산 비용으로도 학습이 가능하게 한다.
  • 불확실성을 표현하기 위해 대각 행렬 공분산을 사용하며, 이는 자연스럽게 클래스 구분 특징을 임베딩 공간의 주축과 일치시킨다.
  • 점 추정치를 확률 분포로 대체함으로써 프로토타입 네트워크를 확장하며, 동일한 아키텍처를 유지하지만 확률적 추론을 추가한다.
  • 학습 목표는 재생성 기반 확률적 backpropagation를 사용하여 사후 분포 하에서 기댓값 분류 오차를 최소화하는 것이다.

실험 결과

연구 질문

  • RQ1임베딩을 랜덤 변수로 모델링함으로써 소수 샘플 학습에서 레이블 노이즈와 데이터 손상에 대한 강건성을 향상시킬 수 있는가?
  • RQ2확률적 프로토타입 기반 접근법이 결정론적 또는 기존의 확률적 방법보다 더 해석 가능하고 분리된 표현을 제공하는가?
  • RQ3SPE는 오픈세트 및 대규모 세트 분류에서 최신 확률적 방법인 Hedged Instance Embeddings(HIB)와 비교해 어떻게 성능을 냈는가?
  • RQ4효율적인 샘플링 전략이 깊이 있는 임베딩 프레임워크에서 전체 베이지안 추론을 가능하게 하면서도 학습 효율성을 유지할 수 있는가?
  • RQ5불확실성 모델링이 소수 샘플 및 오픈세트 학습에서 미지의 클래스로의 일반화에 얼마나 기여하는가?

주요 결과

  • SPE는 지원 인스턴스가 손상된 경우에도 불확실성 인식 추론 덕분에 결정론적 프로토타입 네트워크(PN)보다 유의미하게 뛰어난 성능을 보이며, 소수 샘플 학습에서 뛰어난 성능을 발휘한다.
  • MNIST 기반의 $N$-digit 분류 작업에서, SPE는 모든 6가지 조건(2≤N≤3, 2≤D≤3)에서 HIB를 능가하며, 24개 조건 중 7개만이 SPE가 열등한 경우에 해당한다.
  • SPE는 HIB보다 더 나은 미지의 클래스로의 일반화 성능을 보이며, 새로운 클래스에 대해 의미 있는 임베딩을 생성하지 못하는 HIB와 대비된다. 이는 탁월한 오픈세트 인식 능력을 보여준다.
  • SPE의 대각 공분산 구조는 클래스 구분 특징이 주축과 일치하는 분리된, 해석 가능한 표현을 이끌어내며, HIB의 엉키는 표현과는 대조된다.
  • SPE는 대규모 세트 및 오픈세트 분류 벤치마크에서 최신 기술을 초월하며, 라벨 데이터의 1/3만을 사용하고도 하이퍼파라미터 튜닝 없이 HIB를 능가한다.
  • 교차 샘플러 덕분에 SPE는 결정론적 PN과 비슷한 공간 및 시간 비용으로 학습이 가능하여, 실세계 적용에 있어 확장 가능하고 실용적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.