[论文解读] Variational Mixture-of-Experts Autoencoders for Multi-Modal Deep Generative Models
提出 MMVAE,一种具备 mixture-of-experts 后验的多模态变分自编码器,用以联合建模并跨模态生成,从而实现潜在因子分解、连贯的联合与跨模态生成,以及改善模态特定学习。它在图像–图像和图像–语言任务上优于基于 PoE 的 MVAE。
Learning generative models that span multiple data modalities, such as vision and language, is often motivated by the desire to learn more useful, generalisable representations that faithfully capture common underlying factors between the modalities. In this work, we characterise successful learning of such models as the fulfillment of four criteria: i) implicit latent decomposition into shared and private subspaces, ii) coherent joint generation over all modalities, iii) coherent cross-generation across individual modalities, and iv) improved model learning for individual modalities through multi-modal integration. Here, we propose a mixture-of-experts multimodal variational autoencoder (MMVAE) to learn generative models on different sets of modalities, including a challenging image-language dataset, and demonstrate its ability to satisfy all four criteria, both qualitatively and quantitatively.
研究动机与目标
- 确定成功的多模态生成模型的四个标准:潜在因子分解为共享/私有子空间、连贯的联合生成、连贯的跨生成,以及协同提升单模态性能。
- 引入 MMVAE,具有对各模态的混合专家变分后验,以学习多模态表示。
- 在图像–图像 (MNIST–SVHN) 与图像–语言 (CUB 描述) 任务上演示 MMVAE,包括具有挑战性的 图像↔语言 转换。
- 比较 MMVAE 与 PoE 基于的 MVAE 并分析潜在结构与生成连贯性。
提出的方法
- 使用变分自编码器框架,联合生成模型 p(z, x1:M) = p(z) ∏m p(xm|z)。
- 用单模态后验的混合来近似联合后验: q(z|x1:M) = Σm αm qφm(z|xm),其中 αm = 1/M。
- 采用扩展到多模态的 IWAE 风格界,得到更紧的目标:带有对模态分层采样的 LMoE-IWAE。
- 比较 MoE 与 Product-of-Experts (PoE) 因子分解,并论证在训练时所有模态均存在的情形下 MoE 能获得更好的潜在因子分解与跨生成。
- 使用 Laplace 先验/后验以鼓励轴对齐的潜在表示;使用 Adam/AMSGrad 进行优化。
- 使用定性生成和定量指标进行评估,包括跨生成/连贯性以及潜在空间线性可分离性。
实验结果
研究问题
- RQ1混合专家变分后验能否实现潜在因子分解,从而分离共享与私有模态信息?
- RQ2MMVAE 模型是否能够产生跨模态的连贯联合生成,以及模态之间的连贯跨生成?
- RQ3多模态训练是否提升单一模态的生成,而非产生阻碍(协同效应)?
- RQ4就跨生成连贯性与潜在表示质量而言,MMVAE 相较于基于 PoE 的 MVAE 如何?
- RQ5在单一 MMVAE 框架内,图像↔语言 转换是否可行且连贯?
主要发现
- MMVAE 在潜在因子分解方面优于单模态 VAE 和 PoE MVAE,这一点可通过在 MNIST/SVHN 跨域的数字潜在表示的判别性更强来证明。
- 联合生成连贯性显示 MMVAE 的跨模态对齐度高于 MVAE,由更高的跨生成连贯性指标所证明。
- 跨生成结果表明 MMVAE 能在模态间生成语义一致的数据(例如,以 SVHN 条件的 MNIST 数字,反之亦然)。
- 在 CUB 上,MMVAE 实现联合图像-字幕连贯性,跨生成产生的字幕与图像内容相匹配,反之亦然。
- 与 MVAE 相比,MMVAE 在 CUB 以及 MNIST–SVHN 任务中产生更高的联合生成相关性,表明多模态整合与跨模态信息利用得到提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。