[论文解读] Private-Shared Disentangled Multimodal VAE for Learning of Hybrid Latent Representations
该论文提出了一种解耦的多模态变分自编码器(DMVAE),通过Gumbel-Softmax和正态分布实现混合连续与离散表示,在多个模态之间分离私有和共享潜在空间。该模型在图像-属性基准上提升了半监督学习性能,准确率和F1分数均优于MVAE,尤其在数据不平衡情况下表现更优。
Multi-modal generative models represent an important family of deep models, whose goal is to facilitate representation learning on data with multiple views or modalities. However, current deep multi-modal models focus on the inference of shared representations, while neglecting the important private aspects of data within individual modalities. In this paper, we introduce a disentangled multi-modal variational autoencoder (DMVAE) that utilizes disentangled VAE strategy to separate the private and shared latent spaces of multiple modalities. We specifically consider the instance where the latent factor may be of both continuous and discrete nature, leading to the family of general hybrid DMVAE models. We demonstrate the utility of DMVAE on a semi-supervised learning task, where one of the modalities contains partial data labels, both relevant and irrelevant to the other modality. Our experiments on several benchmarks indicate the importance of the private-shared disentanglement as well as the hybrid latent representation.
研究动机与目标
- 为解决现有多模态VAE仅关注共享表示、忽视模态特异性私有因子的局限性。
- 通过显式分离多模态数据中的私有和共享潜在空间,实现解耦表示学习。
- 利用Gumbel-Softmax和正态分布建模混合潜在因子(连续与离散),以更好地与类别属性对齐。
- 在模态间标签部分可用的设定下提升半监督学习性能,尤其在标签不一致或不平衡时。
- 验证解耦与混合表示可显著提升生成与预测性能。
提出的方法
- 模型为每种模态分别使用编码器和解码器以学习私有潜在表示,同时通过产品-专家(PoE)推理网络推断共享表示。
- 通过VAE目标中的总相关性(TC)正则化强制实现解耦,促进潜在因子之间的独立性。
- 使用Gumbel-Softmax松弛方法对离散潜在因子进行建模,以支持可微采样,适用于面部特征等类别属性。
- 连续潜在因子采用同方差正态分布建模,支持使用重参数化技巧的标准VAE训练。
- 端到端框架通过包含重建与解耦损失项的混合VAE目标,联合优化私有、共享及解耦表示。
- 通过将一个模态的共享潜在变量转移到另一模态进行重建,实现跨模态生成,支持零样本属性迁移。
实验结果
研究问题
- RQ1在半监督设定下,显式分离私有与共享潜在空间是否能提升多模态表示学习性能?
- RQ2对共享与私有因子的解耦如何影响多模态生成与分类任务的性能?
- RQ3对混合连续与离散潜在因子的建模是否能提升多模态数据中与类别属性的对齐效果?
- RQ4在数据不平衡或部分标签可用的情况下,所提出的DMVAE模型相较于MVAE表现如何?
- RQ5通过总相关性正则化强制解耦在多大程度上提升了学习因子的可解释性与解耦程度?
主要发现
- 在全部18个面部属性上,DMVAE在分类准确率与F1分数上均优于MVAE,且随着成对数据增加,性能持续提升。
- 尽管MVAE在100%成对数据下F1分数下降,DMVAE的性能仍持续提升,表明其对数据不平衡具有更强鲁棒性。
- 模型实现了更优的属性迁移质量,定性生成结果显示仅目标属性被修改,而身份与背景得以保持不变。
- 消融研究证实,离散潜在因子显著提升了性能,与面部属性的类别性质高度一致。
- 增加TC正则化权重可提升共享潜在因子的解耦程度,从而提高分类准确率,证明了解耦的重要性。
- Gumbel-Softmax的使用有效支持了离散因子的学习,混合连续-离散表示增强了模型的表达能力与性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。