[论文解读] Relating by Contrasting: A Data-efficient Framework for Multimodal Generative Models
本文提出了一种用于多模态变分自编码器(VAEs)的对比学习框架,通过区分相关与不相关的多模态样本对,提升了数据效率。通过使用对比损失进行训练,该损失在相关样本对上最大化互信息,在不相关样本对上最小化互信息,模型仅使用20%的训练数据即可达到与完整数据基线相当的性能,同时还能从未配对的数据中准确识别出相关样本。
Multimodal learning for generative models often refers to the learning of abstract concepts from the commonality of information in multiple modalities, such as vision and language. While it has proven effective for learning generalisable representations, the training of such models often requires a large amount of "related" multimodal data that shares commonality, which can be expensive to come by. To mitigate this, we develop a novel contrastive framework for generative model learning, allowing us to train the model not just by the commonality between modalities, but by the distinction between "related" and "unrelated" multimodal data. We show in experiments that our method enables data-efficient multimodal learning on challenging datasets for various multimodal VAE models. We also show that under our proposed framework, the generative model can accurately identify related samples from unrelated ones, making it possible to make use of the plentiful unlabeled, unpaired multimodal data.
研究动机与目标
- 为解决多模态生成模型对高数据量的需求,这些模型通常依赖于大量成对的相关数据。
- 通过利用相关与不相关多模态样本对之间的差异,减少对昂贵且需人工标注的多模态数据的依赖。
- 在不牺牲性能的前提下,提升多模态VAE训练的数据效率。
- 利用学习到的相关性信号,使模型能够从未配对、无标签的多模态数据中识别出相关样本。
- 证明基于相关性的对比学习可提升表示学习与跨多种模型和数据集的泛化能力。
提出的方法
- 引入一个伯努利随机变量 r 来建模模态 x 和 y 之间的相关性,其中 r=1 表示一对相关样本,r=0 表示一对不相关样本。
- 设计一种对比损失,当 r=1 时鼓励 x 和 y 之间的点互信息(PMI)较高,当 r=0 时则鼓励 PMI 较低。
- 使用带有潜在变量 z 和相关性指示变量 r 的变分推断框架训练生成模型,实现对相关性和内容的联合建模。
- 使用 x 和 y 之间的 PMI 作为评分,从未配对的多模态数据中识别相关样本对,实现无需额外训练的标签传播。
- 将对比目标应用于多种 VAE 架构(如 MMVAE、cI-MMVAE、cC-MMVAE),并在多个数据集和指标上进行评估。
- 利用生成模型的 PMI 估计实现端到端的相关性预测,避免使用额外的孪生网络。
实验结果
研究问题
- RQ1一种能够区分相关与不相关多模态样本对的对比学习目标,是否能提升多模态 VAE 中的数据效率?
- RQ2在仅使用20%相关训练数据的情况下,基于对比相关性学习训练的生成模型能在多大程度上匹配完整数据基线的性能?
- RQ3模型是否能仅通过生成模型的 PMI 估计,从未配对、无标签的多模态数据中准确识别出相关样本对?
- RQ4该对比框架是否能提升多模态表示在不同架构和数据集上的鲁棒性与泛化能力?
- RQ5变分推断估计器的选择(如 IWAE 与 CUBO)如何影响对比模型在相关性预测与生成任务中的性能?
主要发现
- 所提出的对比框架在多个模型和数据集上,仅使用20%的相关训练数据,即可实现与完整数据基线相当的性能。
- 利用对比模型的 PMI 估计进行标签传播显著提升了性能,尤其在数据稀缺时效果明显——cI-MMVAE 使用10%数据时,性能已匹配完整数据基线。
- cI-MMVAE 在未配对数据上的相关性预测中取得了最高的 F1 分数(0.84),优于孪生网络基线和 cC-MMVAE。
- 对比损失使生成模型能够隐式学习相关性,从而仅通过 PMI 阈值化即可直接识别相关样本对,无需额外训练。
- cC-MMVAE 表现较差,原因在于 CUBO 估计器存在高偏差,表明在该对比设定下,低方差下界估计器(如 IWAE)更为有效。
- 基线模型(MMVAE 和 cC-MMVAE)在应用标签传播后性能下降,凸显了 cI-MMVAE 框架的独特优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。