Skip to main content
QUICK REVIEW

[论文解读] On Implicit Regularization in $β$-VAEs

Abhishek Kumar, Ben Poole|arXiv (Cornell University)|Jan 31, 2020
Generative Adversarial Networks and Image Synthesis被引用 12
一句话总结

本文通过分析变分族如何在解码器中强制实现唯一性和几何结构,揭示了 $β$-VAEs 中的隐式正则化。它推导出一个基于解码器的雅可比矩阵和黑塞矩阵的解析正则化项的确定性自编码目标函数,该函数在 MNIST 和 CelebA 数据集上与 $β$-VAE 在目标值和生成样本质量方面表现出强烈的实验一致性。

ABSTRACT

While the impact of variational inference (VI) on posterior inference in a fixed generative model is well-characterized, its role in regularizing a learned generative model when used in variational autoencoders (VAEs) is poorly understood. We study the regularizing effects of variational distributions on learning in generative models from two perspectives. First, we analyze the role that the choice of variational family plays in imparting uniqueness to the learned model by restricting the set of optimal generative models. Second, we study the regularization effect of the variational family on the local geometry of the decoding model. This analysis uncovers the regularizer implicit in the $β$-VAE objective, and leads to an approximation consisting of a deterministic autoencoding objective plus analytic regularizers that depend on the Hessian or Jacobian of the decoding model, unifying VAEs with recent heuristics proposed for training regularized autoencoders. We empirically verify these findings, observing that the proposed deterministic objective exhibits similar behavior to the $β$-VAE in terms of objective value and sample quality.

研究动机与目标

  • 理解变分推断在 VAE 中对生成模型进行正则化的作用,特别是在缺乏显式归纳偏置的情况下。
  • 研究变分族的选择如何通过限制解空间,影响所学习的生成模型的唯一性和可识别性。
  • 表征变分分布对解码器局部几何结构的正则化效应,特别是通过其协方差结构。
  • 推导出 $β$-VAE 目标函数的确定性近似,通过雅可比矩阵和黑塞矩阵项捕捉其隐式正则化项。
  • 通过实证验证理论近似,并证明所推导的目标函数在目标值和样本质量方面与 $β$-VAE 保持一致。

提出的方法

  • 通过识别在保持边缘似然不变但改变潜在表征的变换,分析变分族对模型唯一性的影响。
  • 在高斯假设下,推导出变分后验 $q(z|x)$ 的协方差与解码器的雅可比矩阵 $J_g(z)$ 之间的关系。
  • 对 $β$-VAE 目标函数进行二阶泰勒展开,以近似变分推断项,从而得到一个带有解析正则化项的确定性目标函数。
  • 提出一种新目标函数 GRAE ≈,用基于 $J_g(z)^\top J_g(z)$ 和 $\Sigma_{z|x}$ 的确定性正则化项替代原始的随机 KL 项。
  • 在训练中使用 GRAE ≈ 目标函数的随机近似,对编码器和解码器正则化项均采用固定的 $β/2$ 权重。
  • 通过在 MNIST 和 CelebA 上比较目标值、FID 分数和样本质量的定性分析,验证该近似的有效性。

实验结果

研究问题

  • RQ1变分族的选择如何影响 $β$-VAEs 中解的唯一性?
  • RQ2$β$-VAE 目标函数中嵌入的隐式正则化项是什么?它与解码器几何结构有何关系?
  • RQ3能否通过基于解码器雅可比矩阵和黑塞矩阵的解析正则化项,构建一个近似 $β$-VAE 目标函数的确定性自编码目标?
  • RQ4所推导的确定性目标函数(GRAE ≈)在目标值和样本质量方面与 $β$-VAE 的行为匹配程度如何?
  • RQ5变分后验协方差结构与解码器雅可比矩阵的局部几何结构之间存在何种关系?

主要发现

  • 变分族的选择,特别是其协方差结构,通过排除不可识别的变换,限制了最优生成模型的集合,从而实现唯一性。
  • 对于高斯变分分布,逆协方差 $\Sigma_{z|x}^{-1}$ 与矩阵 $J_g(h(x))^\top J_g(h(x))$ 密切相关,且 $\Sigma_{z|x}^{-1}$ 中的块对角结构会促进解码器雅可比矩阵格拉姆矩阵中的块对角结构。
  • 所推导的确定性目标函数 GRAE ≈ 在广泛的 $β$ 值范围内均能很好地近似 $β$-VAE 目标函数,目标值高度一致,尤其在小 $β$ 值时表现更优。
  • 在 MNIST 和 CelebA 上的实证评估表明,使用 GRAE ≈ 训练的模型生成的样本质量与 $β$-VAE 相当,当 $β \geq 0.01$ 时,FID 分数保持接近。
  • $β$-VAE 目标函数与其泰勒近似之间的差距随 $β$ 增大而增加,但两者的目标趋势保持一致,验证了近似的准确性。
  • 该分析推广了先前的研究结果(如 Rolinek 等,2019),表明即使在非高斯观测模型下,对角或分块对角的变分后验也会在解码器雅可比矩阵中诱导出相应的结构偏差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。