[论文解读] Hyperprior Induced Unsupervised Disentanglement of Latent Representations
该论文提出协方差超先验变分自编码器(CHyVAE),一种分层贝叶斯方法,通过在潜在空间协方差矩阵上施加逆威沙特超先验,强制实现变分自编码器中的解耦。通过调节超先验的自由度参数,该模型在不修改ELBO的情况下,促使潜在维度间的统计独立性,相较于β-VAE和FactorVAE,在标准数据集和具有相关因子的数据集上均实现了更优的解耦与重构性能。
We address the problem of unsupervised disentanglement of latent representations learnt via deep generative models. In contrast to current approaches that operate on the evidence lower bound (ELBO), we argue that statistical independence in the latent space of VAEs can be enforced in a principled hierarchical Bayesian manner. To this effect, we augment the standard VAE with an inverse-Wishart (IW) prior on the covariance matrix of the latent code. By tuning the IW parameters, we are able to encourage (or discourage) independence in the learnt latent dimensions. Extensive experimental results on a range of datasets (2DShapes, 3DChairs, 3DFaces and CelebA) show our approach to outperform the $β$-VAE and is competitive with the state-of-the-art FactorVAE. Our approach achieves significantly better disentanglement and reconstruction on a new dataset (CorrelatedEllipses) which introduces correlations between the factors of variation.
研究动机与目标
- 解决深度生成模型中无监督解耦的挑战,且不依赖ELBO手术或额外惩罚项。
- 探索通过先验设定实现潜在空间独立性控制的系统性分层贝叶斯方法。
- 通过将潜在先验协方差建模为具有超先验的可学习参数,实现解耦的同时保持重构质量。
- 在具有相关因子变化的数据集上评估该方法,这些数据集是标准解耦方法失效的场景。
- 证明模型级设计——特别是对先验协方差的超先验——可实现优于损失函数修改的解耦效果。
提出的方法
- 该模型在VAE潜在先验p(z|Σ)的协方差矩阵Σ上引入逆威沙特(IW)超先验,从而实现对潜在独立性的系统性控制。
- 超先验的自由度参数ν控制先验的 informativeness,ν越低,越倾向于偏离单位协方差,从而促进解耦。
- 采用结构化变分后验q(z, Σ|x)联合推断潜在代码与协方差矩阵,提升推断的稳定性和表达能力。
- 通过变分推断,该分层先验自然地在ELBO中引入额外项,避免对损失函数进行人为修改。
- 该方法学习完整的协方差矩阵Σ,使模型能够捕捉数据诱导的相关性,而标准VAE则假设各向同性先验。
- 该方法实现为协方差超先验变分自编码器(CHyVAE),通过近似技术实现端到端训练与稳定优化。
实验结果
研究问题
- RQ1是否可以通过系统性的分层先验设定而非损失函数修改,在VAE中实现解耦?
- RQ2对潜在协方差矩阵的超先验调节能在多大程度上影响解耦与重构性能?
- RQ3当数据中因子变化具有相关性时,CHyVAE模型是否比β-VAE和FactorVAE泛化能力更强?
- RQ4是否能够通过学习完整协方差矩阵的分层贝叶斯模型,在解耦任务中超越具有固定或对角先验的模型?
- RQ5超先验分布的选择(如逆威沙特)在多大程度上影响解耦表征的质量?
主要发现
- 在2DShapes、3DChairs、3DFaces和CelebA等所有评估数据集上,CHyVAE在解耦与重构方面均优于β-VAE。
- 在具有强因子相关性的新型CorrelatedEllipses数据集上,CHyVAE在解耦与重构误差方面显著优于β-VAE和FactorVAE。
- 表现最佳的CHyVAE模型实现了0.905的解耦分数,与FactorVAE的0.909相近,但重构保真度更优。
- 潜在变量遍历结果表明,CHyVAE在3DFaces和CelebA上学习到了语义上合理的因子,且捕捉到了3DChairs中腿部风格的变化,而FactorVAE未能识别该特征。
- 训练曲线显示,在不同超参数设置下,CHyVAE的重构误差更低,解耦程度更高,优于β-VAE和FactorVAE。
- 结果表明,通过调节超先验参数即可有效控制解耦,而无需修改ELBO,为ELBO手术提供了一种更系统性的替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。