[论文解读] Learning Hierarchical Priors in VAEs
该论文在变分自编码器(VAEs)中提出一种分层先验,以克服标准正态先验导致的过度正则化问题,采用带重要性加权边界约束优化框架,学习一种非平凡且数据自适应的先验。该方法实现了更平滑、更具可解释性的潜在表征,并在MNIST、Fashion-MNIST和OMNIGLOT数据集上实现了最先进的对数似然性能,同时保持了数据流形的拓扑结构。
We propose to learn a hierarchical prior in the context of variational autoencoders to avoid the over-regularisation resulting from a standard normal prior distribution. To incentivise an informative latent representation of the data, we formulate the learning problem as a constrained optimisation problem by extending the Taming VAEs framework to two-level hierarchical models. We introduce a graph-based interpolation method, which shows that the topology of the learned latent representation corresponds to the topology of the data manifold---and present several examples, where desired properties of latent representation such as smoothness and simple explanatory factors are learned by the prior.
研究动机与目标
- 解决由标准正态先验引起的VAE中过度正则化问题,该问题可能掩盖有意义的数据结构。
- 学习一种反映数据流形内在拓扑结构的分层先验,以提升可解释性和表征质量。
- 将Taming VAEs中的约束优化框架扩展至具有连续混合先验的两级分层模型。
- 开发一种避免后验崩溃并增强潜在表征解耦性的优化算法。
- 通过基于图的插值方法验证学习到的潜在空间在保持数据流形结构方面的质量。
提出的方法
- 将VAE目标扩展为拉格朗日约束优化问题,用由一级潜在变量和二级连续混合先验组成的分层先验替代标准正态先验。
- 使用重要性加权边界近似分层先验的不可计算边缘似然,实现可微训练。
- 采用一种受GECO启发但增强后的新型优化算法,以避免后验崩溃并提升编码质量。
- 应用基于图的插值方法,利用潜在空间中的最近邻关系,评估潜在空间对数据流形的拓扑保真度。
- 引入REWO(重建加权优化)和基于GECO的训练调度,以平衡重建项与先验项。
- 采用两阶段推理模型,其中第一层编码数据,第二层建模分层先验分布。
实验结果
研究问题
- RQ1与标准正态先验相比,VAEs中的分层先验是否能产生更具信息量且不过度正则化的潜在表征?
- RQ2所提出的带分层先验的约束优化框架是否能在潜在空间中保持数据流形的拓扑结构?
- RQ3在对数似然和插值质量方面,该分层先验与SOTA方法(如VampPrior和IWAE)相比表现如何?
- RQ4分层先验能否通过简单回归学习到解耦的、可解释的可变因素(如摆的摆角)?
- RQ5基于图的插值方法是否能揭示比标准基线更平滑、更真实的潜在空间过渡?
主要发现
- VHP + REWO方法在动态MNIST上的测试对数似然达到78.88,优于VampPrior(80.42),并匹配或超越最先进基线。
- 在Fashion-MNIST上,该方法在使用5,000个重要性样本时达到负对数似然225.37,与VampPrior(232.78)和IWAE(226.83)相比相当或更优。
- 在人体运动数据中,VHP实现的插值显著更平滑——通过二阶有限差分的均方根更低——优于VampPrior和IWAE。
- 在3D人脸和椅子数据集上,VHP + REWO生成的插值比IWAE更少模糊、更逼真,定性比较结果表明如此。
- 分层先验成功将摆的摆角作为解耦因子学习到,可通过OLS回归实现准确预测,证明了其可解释性。
- 基于图的插值方法证实,潜在空间的拓扑结构与数据流形一致,验证了学习表征的结构保真度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。