Skip to main content
QUICK REVIEW

[論文レビュー] Relative gradient optimization of the Jacobian term in unsupervised deep learning

Luigi Gresele, Giancarlo Fissore|arXiv (Cornell University)|Jun 26, 2020
Neural Networks and Applications参考文献 2被引用数 7
ひとこと要約

この論文は、逆可換ニューラルネットワークを用いた深層密度モデルの正確な学習のための相対勾配最適化法を提案する。行列パラメータ空間におけるリーマン幾何学を活用することで、入力次元に対する2次計算複雑性を達成する。この手法により、最大尤度学習に不可欠なヤコビアン行列式の項を、構造的制約なしに効率的かつ正確に最適化可能であり、MNISTでは標準的な自動微分より50倍速く、ナーブな手法より4.5倍速く、対数尤度性能は同等または向上する。

ABSTRACT

Learning expressive probabilistic models correctly describing the data is a ubiquitous problem in machine learning. A popular approach for solving it is mapping the observations into a representation space with a simple joint distribution, which can typically be written as a product of its marginals -- thus drawing a connection with the field of nonlinear independent component analysis. Deep density models have been widely used for this task, but their maximum likelihood based training requires estimating the log-determinant of the Jacobian and is computationally expensive, thus imposing a trade-off between computation and expressive power. In this work, we propose a new approach for exact training of such neural networks. Based on relative gradients, we exploit the matrix structure of neural network parameters to compute updates efficiently even in high-dimensional spaces; the computational cost of the training is quadratic in the input size, in contrast with the cubic scaling of naive approaches. This allows fast training with objective functions involving the log-determinant of the Jacobian, without imposing constraints on its structure, in stark contrast to autoregressive normalizing flows.

研究の動機と目的

  • 深層密度モデルにおける正確な最大尤度学習の計算コストの高さ、特にヤコビアン行列式の対数の要因を解決すること。
  • ネットワークアーキテクチャの制限なしに、逆可換ニューラルネットワークにおけるヤコビアン項の正確な最適化を可能にすること。
  • 自己回帰的正規化流れにおける表現力と計算効率のトレードオフを回避するスケーラブルな最適化手法を開発すること。
  • 標準的なバックプロパゲーションと相対勾配更新を統合し、深層潜在変数モデルの効率的学習を可能にすること。
  • 本手法が、著しく短い訓練時間で最先端の対数尤度性能を達成できることを示すこと。

提案手法

  • 本手法は、重み行列の幾何的構造を活用するリーマン多様体自然勾配を行列パラメータ空間に適応した相対勾配を用いたパラメータ更新を定式化する。
  • ヤコビアン行列式の対数の相対勾配について、閉形式の式を導出することで、正確かつ効率的な計算を可能にする。
  • 標準的なバックプロパゲーションとスムーズに統合可能であり、逆可換層を含む深層ニューラルネットワークのエンドツーエンド学習を可能にする。
  • 前向きおよび後向きパスの計算複雑性は、入力次元に対して2次にスケーリングされる。これは、ナーブな自動微分の3次スケーリングとは対照的である。
  • 本手法は一般性を持ち、最大尤度推定や変分推論を含む、ヤコビアン行列式を含む任意の目的関数に適用可能である。
  • 全結合型の逆可換層と滑らかなLeaky-ReLU活性化関数、および標準正規分布の潜在変数を用いる。

実験結果

リサーチクエスチョン

  • RQ1構造的制約なしに、逆可換深層ネットワークにおけるヤコビアン行列式の対数を正確かつ効率的に最適化できるか?
  • RQ2行列パラメータ空間における相対勾配最適化は、入力次元に対して有益にスケーリングされる計算複雑性を達成するか?
  • RQ3本手法は、標準的な自動微分や自己回帰的正規化流れよりも高速な収束と優れた対数尤度性能を達成できるか?
  • RQ4本手法は、次元数やデータの複雑さが異なる多様なデータセットにおいても有効に機能するか?
  • RQ5相対勾配アプローチは、Adam最適化やミニバッチ学習を含む標準的なディープラーニングのトレーニングパイプラインと互換性を持つか?

主な発見

  • 提案手法はヤコビアン項の計算複雑性を、標準的な自動微分のO(D³)からO(D²)に低減し、顕著な高速化を実現する。
  • MNIST(D=784)では、標準的最適化より約4.5倍速く、ナーブな自動微分より約50倍速く、約15分で収束する。
  • POWER、GAS、HEPMASS、MINiboone、BSDS300といったベンチマークデータセットにおいて、最先端の対数尤度性能を達成し、先行手法を同等または上回る。
  • 最良のモデルは、早期停止とグリッドサーチを用いて選別され、公平な比較のため、ハイパーパramータは先行モデルとパラメータ数を一致させるように調整された。
  • 本手法により、任意のヤコビアンを持つ深層密度モデルの正確な学習が可能となり、三角行列構造を持つ流れによる表現制限を回避できる。
  • 実験的結果から、相対勾配アプローチが広範なデータモダリティと入力次元において、スケーラブルかつ有効であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。