[论文解读] An Identifiable Double VAE For Disentangled Representations
该论文提出 Identifiable Double VAE (idVAE),一种变分自编码器框架,通过利用辅助信息学习最优的条件先验,实现理论上保证的解耦。通过结合两个变分自编码器——一个用于学习在辅助变量条件下对潜在变量的后验分布,另一个用于生成建模——该方法增强了正则化和解耦性能,在多个基准测试中持续优于最先进方法,解耦度量指标显著提升。
A large part of the literature on learning disentangled representations focuses on variational autoencoders (VAE). Recent developments demonstrate that disentanglement cannot be obtained in a fully unsupervised setting without inductive biases on models and data. However, Khemakhem et al., AISTATS, 2020 suggest that employing a particular form of factorized prior, conditionally dependent on auxiliary variables complementing input observations, can be one such bias, resulting in an identifiable model with guarantees on disentanglement. Working along this line, we propose a novel VAE-based generative model with theoretical guarantees on identifiability. We obtain our conditional prior over the latents by learning an optimal representation, which imposes an additional strength on their regularization. We also extend our method to semi-supervised settings. Experimental results indicate superior performance with respect to state-of-the-art approaches, according to several established metrics proposed in the literature on disentanglement.
研究动机与目标
- 为解决在完全无监督设置下学习解耦表示的挑战,其中若无归纳偏置,解耦在理论上不可能实现。
- 通过将先验条件化于编码真实因子的辅助变量,设计一种具有理论可识别性保证的基于 VAE 的模型。
- 通过学习条件先验的最优表示,改进从输入到潜在变量的推理映射的正则化。
- 将方法扩展至半监督设置,其中辅助信息仅对部分训练样本可用。
- 通过在多个基准数据集上使用标准度量,实证验证其在解耦性能方面的优越性。
提出的方法
- 该模型采用双 VAE 架构:第一个 VAE 学习在辅助变量条件下对潜在变量的后验分布,作为第二个 VAE 的条件先验。
- 条件先验由将辅助变量映射到潜在变量上结构化先验的推理网络推导得出,确保理论可识别性。
- 主生成模型的 ELBO 被表述为两个 VAE 目标之和,实现解耦与重建的联合优化。
- 通过信息论正则化学习条件先验的最优表示,增强潜在映射的表达能力和稳定性。
- 提出一种半监督变体 ss-idVAE,用于处理仅部分输入具有辅助变量的情况,结合监督与无监督学习。
- 该方法采用基于辅助变量的因子化先验,遵循 Khemakhem 等人(2020)的可识别性框架,但通过改进的正则化和实证性能实现扩展。
实验结果
研究问题
- RQ1基于 VAE 的模型是否可通过将先验条件化于编码真实因子的辅助变量,实现理论可识别性和解耦保证?
- RQ2学习条件先验的最优表示在多大程度上改善了从输入到潜在变量的推理网络的正则化?
- RQ3所提方法在多样化的基准数据集和度量指标上,与最先进解耦模型相比,性能提升程度如何?
- RQ4在半监督设置中,该方法对正则化强度和辅助信息可用性的变化有多强的鲁棒性?
- RQ5当训练期间辅助变量未完全可用时,所提双 VAE 架构是否仍能保持强解耦性能?
主要发现
- idVAE 在所有数据集上均取得最高的中位解耦分数,持续优于最先进方法,包括 β-VAE、iVAE 和 full-VAE。
- 在 dsprites、cars3d 和 shapes3d 数据集上,idVAE 在所有标准解耦度量(包括 beta 分数和显式度)上均表现更优。
- 半监督变体 ss-idVAE 即使仅使用 1% 的标注数据,也优于 β-VAE,并达到全监督 full-VAE 的性能,展现出强大的样本效率。
- idVAE 在广泛范围的正则化强度下表现稳定,解耦分数几乎无下降,而 iVAE 和 full-VAE 等其他方法则表现出对超参数调优的强烈敏感性。
- 当标注样本数量增加时,该方法仍保持强解耦性能,表明其在低数据场景下的鲁棒性与可扩展性。
- 实验结果证实,学习最优条件先验能显著增强推理映射的正则化,从而切实提升解耦质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。