[论文解读] Preventing Posterior Collapse with delta-VAEs
本文提出 δ-VAEs,一种通过在近似后验与先验之间强制最小 KL 散度(δ)来防止变分自编码器后验坍缩的方法,从而在不修改 ELBO 目标的情况下使用强大的自回归解码器。该方法在 CIFAR-10 和 ImageNet 32×32 上实现了最先进(SOTA)的对数似然性能,同时学习到解耦且有意义的表征。
Due to the phenomenon of "posterior collapse," current latent variable generative models pose a challenging design choice that either weakens the capacity of the decoder or requires augmenting the objective so it does not only maximize the likelihood of the data. In this paper, we propose an alternative that utilizes the most powerful generative models as decoders, whilst optimising the variational lower bound all while ensuring that the latent variables preserve and encode useful information. Our proposed $δ$-VAEs achieve this by constraining the variational family for the posterior to have a minimum distance to the prior. For sequential latent variable models, our approach resembles the classic representation learning approach of slow feature analysis. We demonstrate the efficacy of our approach at modeling text on LM1B and modeling images: learning representations, improving sample quality, and achieving state of the art log-likelihood on CIFAR-10 and ImageNet $32 imes 32$.
研究动机与目标
- 为解决 VAE 中的后验坍缩问题,该问题表现为尽管解码器强大,潜在变量却变得无信息。
- 在保持标准 ELBO 训练目标的同时,确保潜在变量携带有用信息。
- 在不削弱模型容量或改变目标函数的前提下,使 VAE 能够使用最先进的自回归解码器。
- 在不牺牲密度建模性能的前提下,为下游任务学习解耦且有意义的表征。
提出的方法
- 在变分后验 q(z|x) 与先验 p(z) 之间引入最小 KL 散度约束 δ,确保后验不会坍缩到先验。
- 将训练目标表述为在满足 D_KL(q(z|x) || p(z)) ≥ δ 的条件下最小化 ELBO,使用约束优化或参数化族实现。
- 采用序列潜在变量结构,并使用反因果编码器来建模时间依赖性,类似于慢特征分析。
- 使用自回归先验(如 AR(1) 或辅助先验)来建模结构化的潜在序列,实现可控生成。
- 通过参数化族(如固定方差的高斯分布)实现约束,以确保训练期间最小 δ 得到强制执行。
- 将该框架应用于图像和文本生成,使用强大的自回归解码器,并联合优化标准 ELBO。
实验结果
研究问题
- RQ1我们能否在不修改 ELBO 目标或削弱解码器的前提下防止 VAE 中的后验坍缩?
- RQ2强制后验与先验之间的最小 KL 散度是否能带来更具信息量和解耦的表征?
- RQ3δ-VAEs 是否能在 CIFAR-10 和 ImageNet 32×32 等图像生成基准上实现最先进(SOTA)的对数似然性能?
- RQ4δ-VAE 框架在为下游任务学习解耦表征方面的有效性如何?
- RQ5使用具有反因果编码器的序列潜在变量是否能提升生成质量与可控性?
主要发现
- δ-VAEs 在 CIFAR-10 上实现了最先进(SOTA)的对数似然性能,优于先前方法,同时使用了强大的自回归解码器。
- 在 ImageNet 32×32 上,δ-VAEs 达到了具有竞争力的对数似然得分,证明了其在高分辨率图像生成中的可扩展性。
- 模型学习到了解耦且可解释的表征,表现为潜在空间中具有意义的线性插值。
- 插值实验表明,生成路径平滑且语义合理,表明表征具有结构化和解耦特性。
- 该方法即使在使用强大解码器时,也能实现高质量的样本生成并保持有意义的解耦性。
- 该框架在保持标准 ELBO 目标的同时,有效防止了后验坍缩,为现有 VAE 架构提供了一种即插即用的解决方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。