Skip to main content
QUICK REVIEW

[논문 리뷰] Augment and Reduce: Stochastic Inference for Large Categorical Distributions

Francisco J. R. Ruiz, Michalis K. Titsias|arXiv (Cornell University)|2018. 02. 12.
Bayesian Methods and Mixture Models참고 문헌 41인용 수 5
한 줄 요약

이 논문은 큰 순서형 분포에 대한 일반적인 확률적 변분 추론 방법인 Augment and Reduce (a&r)를 제안한다. 이 방법은 잠재 변수를 도입하고 주변 가능도의 하한을 최적화하여 계산 비용을 줄인다. 기존의 OVE 및 정확한 소프트맥스와 비교해 더 날카운 하한과 더 나은 예측 성능을 달성하며, 최대 13,000개의 클래스를 가진 대규모 분류 작업에서 특히 유리하다.

ABSTRACT

Categorical distributions are ubiquitous in machine learning, e.g., in classification, language models, and recommendation systems. However, when the number of possible outcomes is very large, using categorical distributions becomes computationally expensive, as the complexity scales linearly with the number of outcomes. To address this problem, we propose augment and reduce (A&R), a method to alleviate the computational complexity. A&R uses two ideas: latent variable augmentation and stochastic variational inference. It maximizes a lower bound on the marginal likelihood of the data. Unlike existing methods which are specific to softmax, A&R is more general and is amenable to other categorical models, such as multinomial probit. On several large-scale classification problems, we show that A&R provides a tighter bound on the marginal likelihood and has better predictive performance than existing approaches.

연구 동기 및 목표

  • 클래스 수 K에 따라 선형적으로 증가하는 큰 순서형 분포를 피팅하는 데 드는 높은 계산 비용을 해결한다.
  • 소프트맥스를 넘어서 다항 프로빗 및 로지스틱 모델 등에 적용 가능한 일반적인 방법을 개발한다.
  • 스토케스틱 변분 EM 및 기타 최적화 프레임워크에 통합할 수 있도록 주변 가능도에 대한 날카운 하한을 제공한다.
  • 낮은 계산 오버헤드를 유지하면서 대규모 분류 작업에서 예측 성능을 향상시킨다.
  • 이미지 분류에서 많은 클래스를 가진 경우나 대규모 아이템 세트를 가진 추천 시스템과 같은 매우 큰 출력 공간을 가진 모델의 스케일러블 훈련을 가능하게 한다.

제안 방법

  • 순서형 분포를 재정의하기 위해 잠재 변수 ε를 도입하여 p(y|ψ) = ∫ p(y,ε|ψ) dε로 표현함으로써 변분 추론을 가능하게 한다.
  • 직접 분할 함수를 계산하지 않고도 주변 가능도의 하한을 최대화하기 위해 스토케스틱 변분 추론을 사용한다.
  • 지역 단계에서는 잠재 변수 ε에 대한 변분 근사치를 최적화하고, 글로벌 단계에서는 ψ를 업데이트하는 두 단계 추론 절차를 적용한다.
  • 지역 단계에서 지수 함수의 재사용을 활용하여 효율성을 유지하며, 계산 비용을 OVE(One-vs-All 추정) 수준으로 유지를 한다.
  • 소프트맥스 및 다항 프로빗 모델 모두에 대한 증거 하한 경계(ELBO)를 수립하며, 후자는 적률 샘플링을 사용해 적분을 근사한다.
  • 대규모 데이터셋에서의 스케일러블 훈련을 가능하게 하기 위해 스토케스틱 변분 EM 프레임워크 내에 이 방법을 통합한다.

실험 결과

연구 질문

  • RQ1소프트맥스 모델을 초월해 대규모 순서형 분포의 추론을 스케일링할 수 있는 일반적인 방법을 개발할 수 있는가?
  • RQ2제안된 a&r 방법이 OVE와 같은 기존 접근법보다 주변 가능도에 대한 더 날카운 하한을 제공하는가?
  • RQ3a&r가 대규모 분류 작업에서 정확한 소프트맥스 및 OVE보다 더 나은 예측 성능(가능도 및 정확도 기준)을 달성할 수 있는가?
  • RQ4다항 프로빗 및 다항 로지스틱 모델에서, 최대 13,000개의 클래스를 가진 데이터셋에서 a&r의 성능은 어떠한가?
  • RQ5특히 에포크당 벽시계 시간 측면에서, a&r는 OVE 및 정확한 소프트맥스에 비해 얼마나 효율적인가?

주요 결과

  • 모든 데이터셋에서 OVE보다 소프트맥스 a&r가 더 날카운 증거 하한 경계(ELBO)를 확보했으며, Bibtex를 제외한 모든 경우에서 정확한 소프트맥스와 거의 동일한 수준이었다.
  • MNIST 및 Bibtex에서 a&r의 ELBO는 최대우도 추정을 통해 확보한 정확한 주변 가능도와 거의 구분되지 않았다.
  • Bibtex를 제외한 모든 데이터셋에서 a&r가 테스트 가능도 및 정확도 측면에서 OVE를 뛰어넘었다. EURLex-4K에서는 OVE가 약간 더 우수한 성능을 보였다.
  • 다항 프로빗 및 로지스틱 모델에서, a&r는 Omniglot 및 Bibtex에서 OVE보다 뛰어난 예측 성능을 달성했으며, 특히 다항 프로빗 a&r가 EURLex-4K와 AmazonCat-13K에서 모든 방법보다 뛰어난 성능을 보였다.
  • 소프트맥스 모델의 경우 a&r의 에포크당 벽시계 시간은 OVE와 거의 동일했으며, 다항 모델의 경우 약간 더 높은 편이었지만 강력한 계산 효율성을 입증했다.
  • AmazonCat-13K와 같이 클래스 수가 13,000에 이르는 경우에도 a&r는 높은 예측 정확도를 유지했으며, 이는 실제 대규모 어휘 작업에 대한 확장성의 가능성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.