Skip to main content
QUICK REVIEW

[论文解读] Learning Disentangled Representations with Reference-Based Variational Autoencoders

Adrià Ruiz, Oriol Martínez|arXiv (Cornell University)|Jan 24, 2019
Generative Adversarial Networks and Image Synthesis参考文献 38被引用 19
一句话总结

该论文提出参考图像基础变分自编码器(Rb-VAEs),一种弱监督方法,通过利用目标因子保持恒定的辅助参考数据集,无需显式标注,学习解耦表征。通过采用对称KL散度和对抗学习重新构建VAE目标函数,该模型成功将目标因子(如面部表情、数字风格)与公共因子解耦,相较于标准VAE,在条件生成和属性迁移任务上表现更优。

ABSTRACT

Learning disentangled representations from visual data, where different high-level generative factors are independently encoded, is of importance for many computer vision tasks. Solving this problem, however, typically requires to explicitly label all the factors of interest in training images. To alleviate the annotation cost, we introduce a learning setting which we refer to as "reference-based disentangling". Given a pool of unlabeled images, the goal is to learn a representation where a set of target factors are disentangled from others. The only supervision comes from an auxiliary "reference set" containing images where the factors of interest are constant. In order to address this problem, we propose reference-based variational autoencoders, a novel deep generative model designed to exploit the weak-supervision provided by the reference set. By addressing tasks such as feature learning, conditional image generation or attribute transfer, we validate the ability of the proposed model to learn disentangled representations from this minimal form of supervision.

研究动机与目标

  • 为解决视觉数据中高层生成因子解耦所需的高标注成本,提出一种弱监督学习设置。
  • 提出一种新型训练目标,克服标准VAE在应用于基于参考的解耦时出现的退化问题。
  • 仅使用目标因子固定的参考图像,实现目标因子与公共因子分离的解耦表征。
  • 在下游任务(如特征学习、条件图像生成和属性迁移)上验证该方法的有效性。

提出的方法

  • 引入基于参考的解耦,一种弱监督设置,仅使用目标因子恒定的参考数据集,无需对目标因子进行显式标注。
  • 提出基于参考的变分自编码器(Rb-VAEs),一种深度生成模型,将潜在空间划分为两部分:用于目标因子(e)和用于公共因子(z)。
  • 采用对称KL散度目标以提升解耦性能,解决标准VAE目标在此设置下的失效问题。
  • 采用对抗学习优化生成器,提升生成样本的质量。
  • 通过重建损失与对抗损失的联合训练,确保生成图像的真实性。
  • 通过固定z并操纵e潜在码,将模型应用于条件图像合成与属性迁移。

实验结果

研究问题

  • RQ1能否仅使用目标因子恒定的参考数据集(无需显式标注)实现最小监督下的解耦表征学习?
  • RQ2为何标准VAE目标在基于参考的解耦设置中失效?何种替代训练目标可克服此问题?
  • RQ3对称KL散度与对抗学习是否能在该弱监督设置中协同提升解耦效果与生成质量?
  • RQ4与标准VAE相比,所学表征在条件图像生成与属性迁移等下游任务中的表现如何?
  • RQ5所提方法在弱监督下的解耦表征学习任务中是否优于现有最先进方法?

主要发现

  • 标准VAE目标在基于参考的设置中导致退化解,造成解耦性能差,下游任务表现弱。
  • 在训练目标中引入对称KL散度显著提升了解耦效果,体现在属性预测任务性能更优。
  • sRb-VAE模型(采用对称KL)的解耦效果优于Rb-VAE(标准VAE),在AffectNet上平均属性预测准确率达.335,在MNIST上达.189。
  • sRb-VAE的条件图像生成能产生更丰富多样的表情变化与风格差异,尤其在建模尺度与动态面部特征方面优于Rb-VAE。
  • 属性迁移实验表明,sRb-VAE能成功迁移如数字风格与面部表情等目标因子,而Rb-VAE无法迁移与尺度相关的属性。
  • 定性结果表明,sRb-VAE能更有效地将目标因子(e)与公共因子(z)分离,实现对高层属性的更有效操控。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。