Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Autoregressive Distribution Estimation

Benigno Uría, Marc-Alexandre Côté|arXiv (Cornell University)|2016. 05. 07.
Generative Adversarial Networks and Image Synthesis참고 문헌 72인용 수 21
한 줄 요약

이 논문은 공유 가중치를 갖는 계층 간에 자동재귀적 곱셈 규칙을 사용하여 연합 데이터 분포를 인수분해하는, 계산 가능하고 피드포워드 신경망 기반의 모델인 신경 자동재귀 분포 추정(NADE)을 소개한다. NADE는 이진, 실수값, 이미지 데이터에서 경쟁력 있는 밀도 추정 성능를 달성하며, 깊이 있는 변형을 통해 순서에 무관한 모델링과 2차원 구조를 위한 컨볼루션 확장이 가능하다.

ABSTRACT

We present Neural Autoregressive Distribution Estimation (NADE) models, which are neural network architectures applied to the problem of unsupervised distribution and density estimation. They leverage the probability product rule and a weight sharing scheme inspired from restricted Boltzmann machines, to yield an estimator that is both tractable and has good generalization performance. We discuss how they achieve competitive performance in modeling both binary and real-valued observations. We also present how deep NADE models can be trained to be agnostic to the ordering of input dimensions used by the autoregressive product rule decomposition. Finally, we also show how to exploit the topological structure of pixels in images using a deep convolutional architecture for NADE.

연구 동기 및 목표

  • 비모수적이고 효율적인 신경망 아키텍처를 개발하여 비지도 분포 및 밀도 추정을 수행한다.
  • 유도적 및 무도적 그래픽 모델에서 주변 가능성 계산의 비계산성 문제를 자동재귀적 인수분해를 통해 해결한다.
  • 자기재귀 조건부 분포 간의 가중치 공유를 통해 고차원 밀도 추정에서 일반화 성능 향상과 과적합 감소를 도모한다.
  • 깊이 있는 아키텍처와 컨볼루션 레이어를 활용하여 NADE를 실수값 데이터 및 2차원 이미지 데이터 모델링으로 확장한다.
  • 입력 차원의 순서에 무관한 모델링을 가능하게 하기 위해 깊이 있는 NADE에서 입력 차원의 순열 불변 표현을 학습한다.

제안 방법

  • 입력 차원의 임의의 순서를 사용하여 연합 분포 $ p(\mathbf{x}) $ 를 조건부 분포의 곱으로 인수분해한다: $ p(\mathbf{x}) = \prod_{d=1}^D p(x_{o_d} \mid \mathbf{x}_{o_{<d}}) $.
  • 각 조건부 분포를 공유 입력-은닉 가중치 $ \mathbf{W} $ 와 공유 편향 $ \mathbf{c} $ 를 갖는 피드포워드 신경망으로 매개변수화하여, 파라미터 수를 $ O(HD^2) $ 에서 $ O(HD) $ 로 감소시킨다.
  • 이진 출력 확률을 모델링하기 위해 파라미터 $ \mathbf{V}_{o_d, \cdot} $ 와 편향 $ b_{o_d} $ 를 갖는 시그모이드 출력 레이어를 사용한다: $ p(x_{o_d}=1 \mid \mathbf{x}_{o_{<d}}) = \text{sigm}(\mathbf{V}_{o_d, \cdot} \mathbf{h}_d + b_{o_d}) $.
  • 은닉 표현 $ \mathbf{h}_d = \text{sigm}(\mathbf{W}_{\cdot, o_{<d}} \mathbf{x}_{o_{<d}} + \mathbf{c}) $ 를 계산하며, 각 조건부 분포에 대해 관련된 입력 차원만 사용한다.
  • 오버피팅 방지를 위해 조기 정지와 가중치 감쇠를 적용한 확률적 경사 하강법을 사용하여 최대우도 기반으로 모델을 훈련한다.
  • 실수값 데이터에 대해서는 각 출력 차원에 대해 혼합 밀도 네트워크(MoG) 또는 라플라스 분포를 사용하고, 이미지 데이터에 대해서는 공유 컨볼루션 커널을 갖는 깊이 있는 컨볼루션 NADE를 사용하여 확장한다.

실험 결과

연구 질문

  • RQ1신경망 기반 자동재귀 모델이 계산 가능한 가능도 계산을 유지하면서도 경쟁력 있는 밀도 추정 성능를 달성할 수 있는가?
  • RQ2NADE에서의 가중치 공유가 독립적인 네트워크 대비 모델 용량, 일반화 성능 및 파라미터 효율성에 어떤 영향을 미치는가?
  • RQ3깊이 있는 NADE 모델은 아키텍처 설계를 통해 입력 순서에 무관하게 만들 수 있는가?
  • RQ4표준 기준 모델 대비 NADE가 2차원 이미지 및 음성 스펙트로그램과 같은 구조적 데이터를 얼마나 효과적으로 모델링하는가?
  • RQ5혼합 밀도 또는 연속형 출력 분포를 사용하여 NADE를 실수값 데이터 모델링으로 확장할 수 있는가?

주요 결과

  • NADE는 이진 MNIST에서 최신 기술 수준의 로그가능도를 달성하며, RBM 및 기타 모델들을 능가한다. 테스트 로그가능도는 1개 예측당 93.1 nats이다.
  • 실수값 이미지 패치에 대해, 각 출력 차원에 10개의 가우시안 혼합을 사용한 NADE는 TIMIT의 코어-테스트 세트에서 1개 예측당 127.8 nats의 로그가능도를 달성하며, MoG 기준 모델보다 15 nats 높다.
  • 음성 스펙트로그램에 대해 훈련된 RNADE 모델은 MoG 대비 더 선명한 포르망 구조를 가지는 생성 샘플을 생성하여 스펙트럼 역학을 더 잘 포착하고 있음을 시사한다.
  • 공유 가중치를 갖는 깊이 있는 NADE 아키텍처는 파라미터 수를 $ O(HD^2) $ 에서 $ O(HD) $ 로 감소시켜 훈련 효율성을 크게 향상시키고 과적합 위험을 줄인다.
  • 컨볼루션 NADE 모델은 이미지의 2차원 위상적 구조를 효과적으로 활용하여 1024개 유닛을 갖는 모델로 자연 이미지 패치에서 경쟁력 있는 성능을 달성한다.
  • 혼합 라플라스 구성요소 또는 SAS(스케일 불확실성 스케일) 분포를 사용한 RNADE는 강력한 성능를 보이며, 최고의 RNADE-MoG 모델($ K=10 $)은 TIMIT에서 127.8 nats를 달성하여 MoG 기준 모델을 크게 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.