[论文解读] Multimodal Generative Models for Compositional Representation Learning
本文提出了一类新型多模态生成模型,采用形式上严谨的变分下界来估计联合似然,纠正了先前多模态 VAE 在边际或条件密度上过度强调的缺陷。该方法在不同模态间结合 VAE、GAN 和归一化流,实现了在联合密度估计和下游组合性任务中的优越性能——尤其在弱监督和模态缺失设置下表现更优,且在使用语言进行训练时能学习到更具抽象性和组合性的视觉表征。
As deep neural networks become more adept at traditional tasks, many of the most exciting new challenges concern multimodality---observations that combine diverse types, such as image and text. In this paper, we introduce a family of multimodal deep generative models derived from variational bounds on the evidence (data marginal likelihood). As part of our derivation we find that many previous multimodal variational autoencoders used objectives that do not correctly bound the joint marginal likelihood across modalities. We further generalize our objective to work with several types of deep generative model (VAE, GAN, and flow-based), and allow use of different model types for different modalities. We benchmark our models across many image, label, and text datasets, and find that our multimodal VAEs excel with and without weak supervision. Additional improvements come from use of GAN image models with VAE language models. Finally, we investigate the effect of language on learned image representations through a variety of downstream tasks, such as compositionally, bounding box prediction, and visual relation prediction. We find evidence that these image representations are more abstract and compositional than equivalent representations learned from only visual data.
研究动机与目标
- 为解决现有多模态 VAE 中缺乏形式上正确的变分下界的问题,这些方法常过度强调边际或条件密度。
- 开发一个统一的目标函数,支持不同模态使用不同生成模型类型(VAE、GAN、流),以实现对图像和文本等复杂数据的混合建模。
- 在弱监督和模态缺失场景下评估性能,这些情况在真实世界多模态数据采集中普遍存在。
- 探究以语言引导的视觉表征是否比纯视觉表征更具组合性与泛化能力。
- 展示利用多模态学习得到的特征在目标检测和视觉关系预测等下游任务中性能的提升。
提出的方法
- 推导出联合边际似然 $\log p_\theta(\mathbf{x}, \mathbf{y})$ 的新变分下界,纠正先前多模态 VAE 使用的错误目标函数。
- 提出一种联合变分散度分解方法,将边际与条件分量分离,确保对联合密度的合法下界。
- 通过允许不同模态使用不同生成模型类型(如文本使用 VAE,图像使用 GAN 或流),实现混合建模。
- 采用联合后验 $q_\phi(\mathbf{z}|\mathbf{x}, \mathbf{y})$,通过高斯乘积组合单模态后验,保持变分推断的一致性。
- 将该目标应用于训练如 VAE-VAE 和 VAE-GAN 等模型,利用 GAN 实现高保真图像生成,同时利用 VAE 进行离散文本建模。
- 通过在小规模配对数据集上训练并利用大规模未配对数据集,实现弱监督,提升泛化能力与对缺失模态的鲁棒性。
实验结果
研究问题
- RQ1与先前的多模态 VAE 相比,是否形式上正确的联合似然变分下界能提升多模态表征学习性能?
- RQ2在不同模态间结合不同生成模型家族(VAE、GAN、流)是否能提升在复杂真实数据集上的性能?
- RQ3多模态生成模型在弱监督和模态缺失条件下的表现如何?
- RQ4通过语言监督学习到的视觉表征是否比纯视觉表征具有更强的组合结构?
- RQ5多模态表征在目标检测和视觉关系预测等下游任务中能提升多少性能?
主要发现
- 所提出的多模态 VAE 在联合似然估计和跨模态翻译任务中优于先前方法,尤其在弱监督和模态缺失条件下表现更优。
- VAE-GAN 模型(语言使用 VAE,图像使用 GAN)在样本质量与表征学习方面均取得显著提升。
- 与语言共同学习的视觉表征展现出更强的组合结构,从而在目标检测与视觉关系预测任务中表现更优。
- 即使在高比例数据缺失的情况下,模型仍保持强大性能,展现出对不完整模态的鲁棒性。
- 新目标函数能正确界定联合边际似然,而先前方法如 MVAE 和 JMVAE 或过度强调边际,或无法界定联合密度。
- 在图像、文本和标签数据集上的实证结果表明,采用该目标函数训练的多模态生成模型可获得更具抽象性与泛化能力的表征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。