Skip to main content
QUICK REVIEW

[論文レビュー] Block Neural Autoregressive Flow

Nicola De Cao, Ivan Titov|arXiv (Cornell University)|Apr 9, 2019
Gaussian Processes and Bayesian Inference参考文献 30被引用数 22
ひとこと要約

本稿では、ブロック構造をとる重み行列を用いて、直接に可逆的で自己回帰的な変換をパrameter化することで、厳密な単調性と可逆性を保証する、コンactな正規化フローであるブロックニューラル自己回帰フロー(B-NAF)を提案する。B-NAFは、NAC やシルベスター・フローなどの既存の汎用近似器と比較して、パラメータ数が桁違いに少ないにもかかわらず、密度推定および変分推論の分野で最先端の性能を達成する。

ABSTRACT

Normalising flows (NFS) map two density functions via a differentiable bijection whose Jacobian determinant can be computed efficiently. Recently, as an alternative to hand-crafted bijections, Huang et al. (2018) proposed neural autoregressive flow (NAF) which is a universal approximator for density functions. Their flow is a neural network (NN) whose parameters are predicted by another NN. The latter grows quadratically with the size of the former and thus an efficient technique for parametrization is needed. We propose block neural autoregressive flow (B-NAF), a much more compact universal approximator of density functions, where we model a bijection directly using a single feed-forward network. Invertibility is ensured by carefully designing each affine transformation with block matrices that make the flow autoregressive and (strictly) monotone. We compare B-NAF to NAF and other established flows on density estimation and approximate inference for latent variable models. Our proposed flow is competitive across datasets while using orders of magnitude fewer parameters.

研究の動機と目的

  • ニューラル自己回帰フロー(NAF)の高いパラメータコスト、特にフロー幅に比例して2乗的に増加する大きなコンditionャー・ネットワークの必要性に対処すること。
  • 可逆性と効率的なヤコビアン計算を維持しながら、密度関数の汎用近似器としてよりコンactなアーキテクチャを構築すること。
  • コンditionャー・ネットワークを別途必要としないように、自己回帰的かつ単調な挙動を直接設計するブロック行列を用いたフィードフォワードネットワークを構築すること。
  • モデルサイズとメモリ使用量を著しく削減しながら、密度推定および変分推論で競争力のある性能を達成すること。
  • 深層潜在変数モデルにおける効率的なアモアタイズド推論を可能にするために、表現力は保ちつつトレーニング可能なパラメータを最小限に抑えること。

提案手法

  • 重み行列をブロックに分割することで、将来の変数からの勾配がゼロになるように設計されたフィードフォワードニューラルネットワークを構築し、自己回帰的構造を保証する。
  • 各ブロックに制約を課して ∂y_i/∂x_i > 0 となるようにすることで、コンditionャー・ネットワークを必要とせずに可逆性を保証する。
  • NAFのハイパーネットワークパラダイムに代わって、1つの共有変換ネットワークでフロー全体をパラメータ化することで、パラメータ数を削減する。
  • 各フローブロックの後に変数の順序を入れ替えることで、すべての次元間の複雑な依存関係をモデル化可能にする。
  • このようなブロックの合成としてフロー構築し、解析的ヤコビアン行列式の計算が可能になるようにすることで、効率的な密度推定とサンプリングを実現する。
  • 変分推論におけるメモリ効率を高めるために、各層で重み行列全体ではなく、バイアスおよび2つのスケーリングベクトルのみを予測することで、フローのパラメータをアモアタイズする。

実験結果

リサーチクエスチョン

  • RQ1大きなコンditionャー・ネットワークに依存せずに、汎用近似器としての正規化フローを設計することは可能か?
  • RQ2最小限のトレーニング可能なパラメータで、直接パラメータ化されたコンactなフローを用いて、密度モデリングにおける汎用近似を達成することは可能か?
  • RQ3自己回帰的かつ単調な構造を直接強制するフローは、NAF や他の確立されたフローと比較して、性能および効率面でどのように差がつくか?
  • RQ4このようなフローは、トレーニング可能なパラメータ数を著しく削減しながらも、アモアタイズド変分推論で強力な性能を維持できるか?
  • RQ5コンditionャー・ネットワークを排除することで、深層生成モデル向けにより効率的かつスケーラブルなアーキテクチャが実現できるか?

主な発見

  • B-NAFは、MNIST、Freyfaces、Omniglot、Caltech 101 シルエットの各データセットで、競争力ある対数尤度性能を達成し、すべてのデータセットで通常のVAE、プランル・フロー、IAFを上回る。
  • 8つのフローと4次元の隠れユニットしか使用していないにもかかわらず、van den Berg ら(2018)の研究で報告された16のフローを有するシルベスター・フローと同等またはそれ以上の性能を達成する。
  • 直交行列およびハウスホルダーのパラメータ化を用いたシルベスター・フローと比較して、B-NAFはトレーニング可能なパラメータを6.16倍から9.35倍まで削減する。
  • IAFと比較して14.45倍もパラメータを削減しており、IAFが同様のタスクに対して著しく過剰にパラメータ化されていることが示された。
  • 1データポイントあたり7.7kパラメータで強力なアモアタイズド変分推論性能を達成した一方、完全にアモアタイズドされたシルベスター・フローは50.7k~76.8kのパラメータを必要としていた。
  • コンditionャー・ネットワークが存在しないため、よりメモリ効率の良いアーキテクチャが実現可能であり、高容量のデコーダを備えた大規模な深層生成モデルに適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。