Skip to main content
QUICK REVIEW

[论文解读] Disentangling Factors of Variation with Cycle-Consistent Variational Auto-Encoders

Ananya Harsh Jha, Saket Anand|arXiv (Cornell University)|Apr 27, 2018
Digital Media Forensic Detection参考文献 25被引用 9
一句话总结

本文提出循环一致性变分自编码器(CC-VAEs),仅通过成对相似性标签的弱监督,实现图像中指定与非指定变化因素的解耦。通过在编码和重建潜在空间之间强制执行循环一致性,该模型防止了退化现象,并在无需对抗训练的情况下实现了鲁棒且高度解耦的表征,其在不同潜在空间维度下的解耦性和稳定性方面优于以往的非对抗性方法。

ABSTRACT

Generative models that learn disentangled representations for different factors of variation in an image can be very useful for targeted data augmentation. By sampling from the disentangled latent subspace of interest, we can efficiently generate new data necessary for a particular task. Learning disentangled representations is a challenging problem, especially when certain factors of variation are difficult to label. In this paper, we introduce a novel architecture that disentangles the latent space into two complementary subspaces by using only weak supervision in form of pairwise similarity labels. Inspired by the recent success of cycle-consistent adversarial architectures, we use cycle-consistency in a variational auto-encoder framework. Our non-adversarial approach is in contrast with the recent works that combine adversarial training with auto-encoders to disentangle representations. We show compelling results of disentangled latent subspaces on three datasets and compare with recent works that leverage adversarial training.

研究动机与目标

  • 解决在缺乏每因子强标注的情况下学习解耦表征的挑战。
  • 开发一种非对抗性生成模型,有效分离指定(带标签)与非指定(干扰)的变化因素。
  • 提高对潜在空间维度选择的鲁棒性,避免标准 VAE 中常见的退化解。
  • 证明循环一致性通过最小化指定与非指定潜在子空间之间的信息泄漏,实现了对解耦的强制。
  • 提供一种对抗性解耦方法的弱监督替代方案,避免训练不稳定性与泛化能力差的问题。

提出的方法

  • 模型使用两个独立的潜在空间:一个用于指定因素(s),一个用于非指定因素(z),每个空间具有独立的先验分布。
  • 通过在编码至 s 和 z 空间后,再对重建结果重新编码,形成闭环,应用循环一致性损失,以确保循环中的一致性。
  • 编码器将输入图像映射到 s 和 z 空间,解码器则从 s 和 z 重建图像,强制重建过程保持解耦性。
  • 训练目标结合标准 VAE 的重构损失与 KL 散度损失,以及惩罚原始数据与循环重建数据之间偏差的循环一致性损失。
  • 使用成对相似性标签对具有相同指定因素的图像进行分组(例如,相同数字类别),实现弱监督,而无需每因子标注。
  • 模型通过随机梯度下降端到端训练,无需对抗判别器,因此相比 GAN 基础方法更简单且更稳定。

实验结果

研究问题

  • RQ1在弱监督设置下,循环一致性能否有效用于解耦指定与非指定的变化因素?
  • RQ2具有循环一致性的非对抗性 VAE 是否能避免标准 VAE 中常见的退化问题,即解码器忽略指定潜在变量?
  • RQ3解耦性能对指定与非指定潜在空间维度变化的鲁棒性如何?
  • RQ4通过在不同图像之间插值或交换潜在因子,模型能否生成高质量且可控的图像样本?
  • RQ5在缺乏强监督的情况下,循环一致性是否能带来优于对抗训练的解耦效果?

主要发现

  • 所提出的 CC-VAE 模型即使在高维潜在空间下,也能成功避免解码器忽略指定潜在变量的退化解。
  • 该模型在三个数据集(MNIST、2D Sprites 和 LineMod)上均表现出鲁棒的解耦性,且无需对抗训练或对维度进行超参数调优。
  • 图像生成结果清晰展示了解耦效果:在图像间交换 z 因子可产生视角或纹理的合理变化,而交换 s 因子则如预期改变了类别身份。
  • 在 s 和 z 空间中的线性插值产生了平滑且有意义的过渡,证实了每个潜在空间分别捕捉了独立且解耦的变化因素。
  • 通过从标准高斯分布采样 z 并固定 s 进行条件生成,可产生多样且合理的样本,证实了模型的生成能力。
  • 与 Szabó 等人 [8] 的非对抗性方法相比,CC-VAE 在广泛的潜在空间维度范围内均保持性能稳定,而后者对维度选择极为敏感。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。