Skip to main content
QUICK REVIEW

[논문 리뷰] Block Neural Autoregressive Flow

Nicola De Cao, Ivan Titov|arXiv (Cornell University)|2019. 04. 09.
Gaussian Processes and Bayesian Inference참고 문헌 30인용 수 22
한 줄 요약

이 논문은 블록 구조의 가중치 행렬을 사용하여 직접적으로 가역적이고 자동회귀적인 변환을 파rameter화함으로써 엄격한 단조성과 가역성을 보장하고 별도의 컨ditioner 네트워크 없이도 작동하는 컴act한 정규화 흐름인 블록 신경 자동회귀 흐름(B-NAF)을 소개한다. B-NAF는 기존의 NAF 및 실릴러스 흐름과 같은 보편적 근사기보다 수개의 매개변수로 훨씬 적은 매개변수를 사용하면서도 최첨단의 밀도 추정 및 변분 추론 성능을 달성한다.

ABSTRACT

Normalising flows (NFS) map two density functions via a differentiable bijection whose Jacobian determinant can be computed efficiently. Recently, as an alternative to hand-crafted bijections, Huang et al. (2018) proposed neural autoregressive flow (NAF) which is a universal approximator for density functions. Their flow is a neural network (NN) whose parameters are predicted by another NN. The latter grows quadratically with the size of the former and thus an efficient technique for parametrization is needed. We propose block neural autoregressive flow (B-NAF), a much more compact universal approximator of density functions, where we model a bijection directly using a single feed-forward network. Invertibility is ensured by carefully designing each affine transformation with block matrices that make the flow autoregressive and (strictly) monotone. We compare B-NAF to NAF and other established flows on density estimation and approximate inference for latent variable models. Our proposed flow is competitive across datasets while using orders of magnitude fewer parameters.

연구 동기 및 목표

  • 신경 자동회귀 흐름(NAFs)의 높은 매개변수 비용 문제를 해결하기 위해, 유연성의 흐름 너비에 따라 제곱적으로 증가하는 큰 컨ditioner 네트워크가 필요한 문제를 해결하고자 한다.
  • 가역성과 효율적인 자코비안 행렬 계산을 유지하면서도 밀도 함수에 대한 보편적 근사기로서 더 컴팩트한 근사기 개발을 목표로 한다.
  • 컨ditioner 네트워크를 별도로 필요로 하지 않도록, 자동회귀적이고 단조적인 행동을 강제하는 블록 행렬로 구성된 피드포워드 네트워크를 직접 설계함으로써 이를 달성하고자 한다.
  • 모델 크기와 메모리 사용량을 크게 줄임과 동시에 밀도 추정 및 변분 추론에서 경쟁 가능한 성능을 달성하고자 한다.
  • 깊은 잠재변수 모델에서의 효율적인 암시적 추론을 가능하게 하기 위해, 표현력을 유지하면서도 학습 가능한 매개변수를 최소화하고자 한다.

제안 방법

  • 가중치 행렬을 블록 행렬으로 분할하여 향후 변수로부터의 기울기가 0이 되도록 설계함으로써 자동회귀적 구조를 보장하는 피드포워드 신경망을 설계한다.
  • 각 블록에 대해 ∂y_i/∂x_i > 0 조건을 부여함으로써 엄격한 단조성을 확보하여, 별도의 컨ditioner 네트워크 없이도 가역성을 보장한다.
  • NAFs의 하이퍼네트워크 철학을 대체하기 위해 단일 공유 전환 네트워크를 사용하여 매개변수 수를 감소시킨다.
  • 각 흐름 블록 이후 변수의 순서를 재배열하여 모든 차원 간의 복잡한 의존성을 모델링할 수 있도록 한다.
  • 이러한 블록의 조합으로 흐름을 구성함으로써, 계산 가능한 자코비안 행렬식을 통해 효율적인 밀도 평가 및 샘플링을 가능하게 한다.
  • 각 레이어에서 전체 가중치 행렬 대신 편향과 두 개의 스케일링 벡터만 예측함으로써 매개변수를 암시적으로 추론함으로써, 변분 추론에서 메모리 효율성을 높인다.

실험 결과

연구 질문

  • RQ1큰 컨ditioner 네트워크에 의존하지 않고도 보편적 근사기로 작동하는 정규화 흐름을 설계할 수 있는가?
  • RQ2매우 적은 학습 가능한 매개변수를 가진 직접 파rameter화된 흐름을 통해 밀도 모델링에서 보편적 근사가 가능할 수 있는가?
  • RQ3직접 자동회귀적이고 단조적인 구조를 강제하는 흐름이 NAFs 및 기타 기존의 흐름과 비교해 성능 및 효율성 측면에서 어떻게 성과를 내는가?
  • RQ4이러한 흐름은 학습 가능한 매개변수 수를 크게 줄임과 동시에 암시적 변분 추론에서 강력한 성능을 유지를 할 수 있는가?
  • RQ5컨ditioner 네트워크를 제거함으로써 깊은 생성 모델에 더 효율적이고 확장 가능한 아키텍처를 얻을 수 있는가?

주요 결과

  • B-NAF는 MNIST, Freyfaces, Omniglot, Caltech 101 Silhouettes에서 경쟁적인 로그우도 성능을 달성하였으며, 모든 데이터셋에서 일반적인 VAE, 플레인어 플로우, IAFs를 초월한다.
  • 단지 8개의 흐름과 4차원의 은닉 유닛을 사용함에도 불구하고, van den Berg 등(2018)의 연구에서 사용된 16개의 흐름을 가진 모델들(예: 실릴러스 플로우)과 동등하거나 그 이상의 성능을 보였다.
  • 오르토곤럴 및 하우스홀더 파라미터화된 실릴러스 플로우에 비해 각각 6.16배에서 9.35배 적은 학습 가능한 매개변수를 사용한다.
  • IAFs에 비해 14.45배 적은 매개변수를 사용함으로써, IAFs가 동일한 작업에 대해 상당히 과도하게 파라미터화되어 있음을 보여준다.
  • 각 데이터 포인트당 단지 7.7만 개의 매개변수만을 사용함으로써 암시적 변분 추론에서 뛰어난 성능을 달성하였으며, 이는 완전히 암시된 실릴러스 플로우의 50.7만~76.8만 개의 매개변수 대비 현저히 낮은 수준이다.
  • 컨ditioner 네트워크가 없기 때문에 더 메모리 효율적인 아키텍처를 구현할 수 있어, 고용량 디코더를 가진 대규모 깊은 생성 모델에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.