Skip to main content
QUICK REVIEW

[논문 리뷰] Relative gradient optimization of the Jacobian term in unsupervised deep learning

Luigi Gresele, Giancarlo Fissore|arXiv (Cornell University)|2020. 06. 26.
Neural Networks and Applications참고 문헌 2인용 수 7
한 줄 요약

이 논문은 역행렬 신경망을 사용한 정확한 훈련을 위한 상대 기울기 최적화 방법을 제안한다. 매트릭스 매개변수 공간에서 리만 기하학을 활용하여 입력 차원에 대해 이차적 계산 복잡도를 달성한다. 이 방법은 아키텍처 제약 없이 잼코비안 행렬식 항을 효율적이고 정확하게 최적화할 수 있게 하여, 표준 자동 미분 대비 최대 50배 빠르고, 난이도 있는 방법 대비 4.5배 빠르게 MNIST에서 훈련을 수행하며, 로그우도 성능은 동등하거나 향상시킨다.

ABSTRACT

Learning expressive probabilistic models correctly describing the data is a ubiquitous problem in machine learning. A popular approach for solving it is mapping the observations into a representation space with a simple joint distribution, which can typically be written as a product of its marginals -- thus drawing a connection with the field of nonlinear independent component analysis. Deep density models have been widely used for this task, but their maximum likelihood based training requires estimating the log-determinant of the Jacobian and is computationally expensive, thus imposing a trade-off between computation and expressive power. In this work, we propose a new approach for exact training of such neural networks. Based on relative gradients, we exploit the matrix structure of neural network parameters to compute updates efficiently even in high-dimensional spaces; the computational cost of the training is quadratic in the input size, in contrast with the cubic scaling of naive approaches. This allows fast training with objective functions involving the log-determinant of the Jacobian, without imposing constraints on its structure, in stark contrast to autoregressive normalizing flows.

연구 동기 및 목표

  • 딥 디퍼런스 모델에서 잼코비안의 로그행렬식으로 인한 정확한 최대우도 훈련의 높은 계산 비용 문제를 해결하기 위해.
  • 아키텍처 제약 없이 역행렬 신경망에서 잼코비안 항을 정확하게 최적화할 수 있도록 하기 위해.
  • 자기회귀 정규화 플로우에서 내재된 표현력과 계산 효율성 사이의 상충 관계를 피하는 확장 가능한 최적화 방법을 개발하기 위해.
  • 표준 백프로파게이션과 상대 기울기 업데이트를 통합하여 깊은 잠재변수 모델의 효율적 훈련을 가능하게 하기 위해.
  • 이 방법이 훨씬 줄어든 훈련 시간으로 최신 기술 수준의 로그우도 성능을 달성할 수 있음을 입증하기 위해.

제안 방법

  • 매개변수 갱신을 상대 기울기, 즉 매트릭스 매개변수 공간에 적합한 리만 기하학 기반 자연 기울기로 공식화하여, 가중치 매트릭스의 기하학적 구조를 활용한다.
  • 잼코비안 행렬식의 상대 기울기의 닫힌 형태 표현식을 유도하여 정확하고 효율적인 계산을 가능하게 한다.
  • 표준 백프로파게이션과 원활하게 통합되어, 역행렬 레이어를 포함한 딥 네트워크의 엔드 투 엔드 훈련을 허용한다.
  • 전방 및 역방향 전파의 계산 복잡도는 입력 차원에 대해 이차적으로 증가하지만, 난이도 있는 자동 미분의 세제곱적 증가와 대비된다.
  • 이 방법은 잼코비안 행렬식을 포함한 모든 목적 함수에 일반적으로 적용 가능하며, 최대우도 추정 및 변분 추론 등에 응용할 수 있다.
  • 완전히 연결된 역행렬 레이어와 부드러운 Leaky-ReLU 활성화 함수, 잠재변수에 대한 표준 정규 기저 분포를 사용한다.

실험 결과

연구 질문

  • RQ1역행렬 딥 네트워크에서 잼코비안의 로그행렬식은 아키텍처 제약 없이 정확하고 효율적으로 최적화될 수 있는가?
  • RQ2매트릭스 매개변수 공간에서의 상대 기울기 최적화는 입력 차원에 대해 유리한 복잡도 스케일링을 제공하는가?
  • RQ3이 방법은 표준 자동 미분 또는 자기회귀 정규화 플로우보다 더 빠른 수렴과 향상된 로그우도 성능을 달성할 수 있는가?
  • RQ4다양한 차원과 데이터 복잡도를 가진 다양한 데이터셋에서 이 방법의 성능은 어떠한가?
  • RQ5상대 기울기 접근법은 Adam 최적화 및 배치 훈련을 포함한 표준 딥 러닝 훈련 파이프라인과 호환되는가?

주요 결과

  • 제안된 방법은 잼코비안 항에 대해 O(D²)의 계산 복잡도를 달성하여, 표준 자동 미분의 O(D³)에 비해 상당한 속도 향상을 이룬다.
  • MNIST(D=784)에서 이 방법은 표준 최적화보다 약 4.5배 빠르고, 난이도 있는 자동 미분보다 약 50배 빠르며, 약 15분 내에 수렴한다.
  • POWER, GAS, HEPMASS, MINiboone, BSDS300 등의 벤치마크 데이터셋에서 최신 기술 수준의 로그우도 성능을 달성하였으며, 이전 방법을 동등하거나 초월하였다.
  • 최고 성능의 모델은 조기 정지와 그리드 서치를 통해 선택되었으며, 비교를 위해 이전 모델의 파라미터 수와 동일하게 하이퍼파rameter를 조정하였다.
  • 이 방법은 삼각형 구조 플로우의 표현 한계를 피하면서도 임의의 잼코비안을 가진 딥 디퍼런스 모델의 정확한 훈련을 가능하게 한다.
  • 실험 결과는 상대 기울기 접근법이 다양한 데이터 모달리티와 입력 차원에서 확장 가능하고 효과적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.