[論文レビュー] A Prior of a Googol Gaussians: a Tensor Ring Induced Prior for Generative Models
本稿では、テンソルリング分解を用いて高次元格子上に10^100個を超えるガウス分布を凝縮する、Tensor Ring Induced Prior (TRIP) を提案する。これにより、複雑でマルチモーダルな分布の効率的モデリングが可能となり、GANにおけるFrećhet Inception Distance (FID) とVAEにおけるEvidence Lower Bound (ELBO) が向上する。また、欠損した属性を含む条件付き生成も可能で、標準的なガウス分布およびGMMの事前分布を上回る性能を発揮する。
Generative models produce realistic objects in many domains, including text, image, video, and audio synthesis. Most popular models---Generative Adversarial Networks (GANs) and Variational Autoencoders (VAEs)---usually employ a standard Gaussian distribution as a prior. Previous works show that the richer family of prior distributions may help to avoid the mode collapse problem in GANs and to improve the evidence lower bound in VAEs. We propose a new family of prior distributions---Tensor Ring Induced Prior (TRIP)---that packs an exponential number of Gaussians into a high-dimensional lattice with a relatively small number of parameters. We show that these priors improve Fréchet Inception Distance for GANs and Evidence Lower Bound for VAEs. We also study generative models with TRIP in the conditional generation setup with missing conditions. Altogether, we propose a novel plug-and-play framework for generative models that can be utilized in any GAN and VAE-like architectures.
研究の動機と目的
- 標準的なガウス分布よりも洗練された事前分布を導入することで、GANにおけるモード崩壊の緩和とVAEにおけるELBOの向上を図ること。
- コンactパラメータ化を用いて、10^100個を超える成分を持つ指数的多数の成分を持つ事前分布を表現すること。
- 一部の属性が欠損している場合でも、効率的なサンプリング、周辺化、条件付き生成を可能にすること。
- 任意のGANまたはVAEアーキテクチャにアーキテクチャの変更なしに組み込める、プラグアンドプレイ型の事前分布を開発すること。
提案手法
- 事前分布を、格子上に配置されたモードを持つ高次元離散的または連続的ガウス混合モデル (GMM) として表現する。
- テンソルリング分解を用いて、少数のパラメータで結合分布をパラメータ化し、結合確率、周辺確率、条件付き確率の効率的計算を可能にする。
- テンソルコアから導出された行列の積のトレースとして、潜在ベクトルの確率を計算する: $\widehat{P}[r_{1:d}] = \operatorname{Tr}\left(\prod_{j=1}^{d} Q_j[r_j]\right)$。
- テンソルコア内の学習可能なパラメータを用いて連続的潜在空間をモデル化することで、連続的GMMとしての事前分布を拡張する。
- 条件付き確率を結合確率と周辺確率の比として計算することで、部分的な条件付き情報がある場合の条件付き生成を可能にする。
- 標準的なVAEまたはGANの目的関数を用いて、TRIPを事前分布としてエンドツーエンドで学習する。
実験結果
リサーチクエスチョン
- RQ1指数的多数の成分(10^100個を超えるガウス分布)を持つ事前分布は、標準的なガウス事前分布を上回る生成モデルの品質向上を実現できるか?
- RQ2テンソルリング分解のようなコンパクトなパラメータ化は、過学習を回避しつつも、高次元でマルチモーダルな事前分布を効率的に表現できるか?
- RQ3TRIPは、標準的およびGMM事前分布と比較して、GANにおけるFIDとVAEにおけるELBOを向上させるか?
- RQ4一部の属性が提供されている場合でも、TRIPは効果的な条件付き生成を可能にするか?
主な発見
- CelebAではWGAN-GPを用いてFIDを52.86に低下させ、ベースラインのWGAN-GP (54.71) やCIFAR-10におけるSOTAのSN-GAN (21.7) を上回った。
- VAE-TRIPモデルはELBOを-193.32に達成し、標準VAE(ガウス事前分布:-194.16)およびGMM事前分布(-201.60)を上回った。
- CIFAR-10では、WGAN-GP-TRIPがFID16.72を達成し、WGAN-GP (29.3) を顕著に上回り、SOTA性能に近づいた。
- モードホッピングの可視化から、潜在空間における近接したモードは意味的に類似した画像変化に対応しており、分離可能で局所的な表現であることが示された。
- 欠損した属性を含む条件付き生成では、さまざまな髪型、眼鏡、帽子を備えた若者男性の多様な画像が生成され、部分的条件付き情報に対しても頑健であることが示された。
- 指数的多数の成分を有しながらも、TRIPは全モデルパラメータの10%未満を占め、過学習を回避し、効率的な学習が可能となった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。