Skip to main content
QUICK REVIEW

[論文レビュー] Consistency Regularization for Variational Auto-Encoders

Samarth Sinha, Adji Bousso Dieng|arXiv (Cornell University)|May 31, 2021
Generative Adversarial Networks and Image Synthesis参考文献 1被引用数 11
ひとこと要約

本稿では、変分オートエンコーダー(VAEs)における一貫性正則化を提案し、入力画像とその意味を保つ変換(例:回転、平行移動)に対して類似した潜在表現を強制する。画像とその拡張版のエンコーダーの事後分布間のKLダイバージェンスを最小化することで、複数のVAEバリアントおよびデータセットにおいて表現品質と一般化性能が向上し、CR-VAEおよびCR-NVAEを用いてMNIST、CIFAR-10、CelebA、3D点群で最先端の性能を達成した。

ABSTRACT

Variational auto-encoders (VAEs) are a powerful approach to unsupervised learning. They enable scalable approximate posterior inference in latent-variable models using variational inference (VI). A VAE posits a variational family parameterized by a deep neural network called an encoder that takes data as input. This encoder is shared across all the observations, which amortizes the cost of inference. However the encoder of a VAE has the undesirable property that it maps a given observation and a semantics-preserving transformation of it to different latent representations. This "inconsistency" of the encoder lowers the quality of the learned representations, especially for downstream tasks, and also negatively affects generalization. In this paper, we propose a regularization method to enforce consistency in VAEs. The idea is to minimize the Kullback-Leibler (KL) divergence between the variational distribution when conditioning on the observation and the variational distribution when conditioning on a random semantic-preserving transformation of this observation. This regularization is applicable to any VAE. In our experiments we apply it to four different VAE variants on several benchmark datasets and found it always improves the quality of the learned representations but also leads to better generalization. In particular, when applied to the Nouveau Variational Auto-Encoder (NVAE), our regularization method yields state-of-the-art performance on MNIST and CIFAR-10. We also applied our method to 3D data and found it learns representations of superior quality as measured by accuracy on a downstream classification task.

研究の動機と目的

  • 意味的に同等の画像(例:回転や平行移動されたもの)が、潜在空間内で異なる領域にマップされるVAEエンコーダーの不一致問題に対処すること。
  • 元のアーキテクチャを変更せずに、学習された表現の品質と一般化性能を向上させること。
  • 任意のVAEバリアントに適用可能な正則化手法を開発し、下流タスクおよび生成モデルの性能を向上させること。
  • 標準ベンチマークデータセット(画像および3D点群データを含む)において、一貫性正則化VAEを用いて最先端の結果を示すこと。

提案手法

  • 入力画像とその意味を保つ変換(例:回転、平行移動、スケーリング、ジャッタリング)によって得られる画像の間で、変分事後分布のKLダイバージェンスを最小化する一貫性正則化項を導入する。
  • 標準VAE目的関数(ELBO)と一貫性損失を同時に最適化することで、訓練中に正則化を適用する。
  • データ拡張(例:回転、平行移動、スケーリング、ジャッタリング)を用いて、意味的に同等の画像および点群の変換を生成する。
  • VAE、IWAE、β-VAE、NVAEなどの複数のVAEバリアントに、一貫性損失をそれらの訓練目的関数に統合することで、この手法を拡張する。
  • バックボーンとしてFoldingNetを用い、3D点群データに適用する。FoldingNetをVAEに変換し、潜在空間に一貫性正則化を追加する。
  • 確率的勾配降下法を用いてモデルをエンドツーエンドで訓練し、潜在変数のモンテカルロサンプリングにより一貫性損失を計算する。

実験結果

リサーチクエスチョン

  • RQ1エンコーダーの潜在表現における一貫性を強制することで、VAEsにおける表現品質が向上するか?
  • RQ2一貫性正則化は、多様なVAEアーキテクチャおよびデータセットにおいて一般化性能を向上させるか?
  • RQ3この手法は、トリプルット損失などの強力な対照学習ベースラインを上回るか?
  • RQ4一貫性正則化は、3D点群の再構成および分類タスクの性能を向上させるか?
  • RQ5この手法は、MNIST、CIFAR-10、CelebAといった標準画像ベンチマークで最先端の結果を達成できるか?

主な発見

  • 一貫性正則化は、VAE、IWAE、β-VAE、NVAEの4つのVAEバリアントにおいて、MNIST、CIFAR-10、CelebAで一貫して表現品質と一般化性能を向上させた。
  • CR-NVAEは、MNISTおよびCIFAR-10で最先端の対数尤度性能を達成し、ベースラインNVAEを上回った。
  • ShapeNet 3D点群データセットにおいて、CR-FoldingNetは線形SVM分類タスクで84.6%の精度を達成したのに対し、ベースラインFoldingNetは82.5%であった。
  • CR-FoldingNetの再構成誤差は0.0327(Chamfer距離)であり、ベースラインの0.0355から低下しており、生成品質の向上を示している。
  • CR-FoldingNetを用いた潜在空間内での補間は、物体クラス間で滑らかで解釈可能な遷移を生成し、分離可能で意味のある潜在空間を示している。
  • この手法は、3Dデータにおける下流分類精度において、強力な対照学習ベースラインであるトリプルット損失を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。