[论文解读] An Improved Semi-Supervised VAE for Learning Disentangled Representations
本文提出在半监督变分自编码器(LaRVAE)中采用标签替换机制,通过在有可用时用真实标签替换推理出的潜在代码,以提升解耦表征学习的效果。该方法通过使用真实标签正则化解码器,增强了模型的解耦能力,在合成数据集和真实世界数据集上均优于先前的半监督变分自编码器,在解耦质量与可控生成方面表现更优。
Learning interpretable and disentangled representations is a crucial yet challenging task in representation learning. In this work, we focus on semi-supervised disentanglement learning and extend work by Locatello et al. (2019) by introducing another source of supervision that we denote as label replacement. Specifically, during training, we replace the inferred representation associated with a data point with its ground-truth representation whenever it is available. Our extension is theoretically inspired by our proposed general framework of semi-supervised disentanglement learning in the context of VAEs which naturally motivates the supervised terms commonly used in existing semi-supervised VAEs (but not for disentanglement learning). Extensive experiments on synthetic and real datasets demonstrate both quantitatively and qualitatively the ability of our extension to significantly and consistently improve disentanglement with very limited supervision.
研究动机与目标
- 解决在仅有有限真实标签可用的半监督设置下学习解耦表征的挑战。
- 通过引入有限监督,克服无监督解耦学习中的非可识别性问题。
- 通过有效利用有标签数据与变分自编码器的生成结构,提升解耦性能。
- 构建一个理论基础坚实的框架,统一半监督变分自编码器中标签替换与标准标签损失的关系。
- 在多种数据集上持续提升解耦质量与可控生成能力。
提出的方法
- 引入标签替换机制:在训练过程中,当真实标签可用时,用真实标签 $ \mathbf{y} $ 替换推理出的潜在代码 $ q_{\phi}(\bm{\xi}|\mathbf{x}) $。
- 修改变分自编码器目标函数,引入使用真实标签指导数据生成的正则化解码器损失。
- 在变分自编码器框架下,提出一个通用的半监督解耦表征学习框架,自然地整合标签替换与标签损失项。
- 采用具有因子分解先验 $ p(\bm{\xi}) $ 和深度神经网络解码器 $ p_{\theta}(\mathbf{x}|\bm{\xi}) $ 的变分自编码器,并应用总相关性正则化以促进解耦。
- 使用包含标准无监督损失与标签替换正则化项的改进ELBO目标函数进行模型训练。
- 应用标签遍历法评估解耦性:固定其他标签维度,仅改变一个维度,生成图像以评估控制能力与一致性。
实验结果
研究问题
- RQ1有限的真实标签是否能在半监督变分自编码器设置中显著提升解耦性能?
- RQ2标签替换与标准标签损失相比,在提升解耦性能方面表现如何?
- RQ3标签替换在多大程度上能提升解耦表征学习中生成样本的可控性?
- RQ4所提出方法是否在减少模式崩溃或生成数据分布偏移的同时,仍能保持良好的解耦质量?
- RQ5标签替换机制是否能在统一的理论框架下,被合理地解释为半监督解耦表征学习的一部分?
主要发现
- LaRVAE在合成数据集(dSprites、3DShapes)和真实世界数据集(CelebA)上,相较于基线模型SS-β-TCVAE,显著提升了解耦性能。
- 标签遍历结果表明,LaRVAE生成的图像仅在目标属性维度上发生变化,而其他固定属性保持正确,而基线模型则无法实现这种精确控制。
- 在3DShapes数据集中,LaRVAE成功生成了在对象颜色、大小和形状上按标签维度预期变化的图像,而基线模型则无法正确控制相应属性。
- 在CelebA数据集中,当遍历对应标签维度时,LaRVAE能生成具有正确面部属性(如苍白肤色、齐刘海、戴眼镜)的图像,表现出优于基线的控制能力。
- 定性结果表明,LaRVAE在固定标签维度下能保持生成图像中属性的一致性,而基线模型常引入错误属性(如错误的墙壁或物体颜色)。
- 尽管存在轻微瑕疵(如错误的墙壁颜色),LaRVAE在定量解耦指标与定性生成质量方面均持续优于基线模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。