[论文解读] Dizygotic Conditional Variational AutoEncoder for Multi-Modal and Partial Modality Absent Few-Shot Learning
该论文提出了一种新型的多模态数据增强方法——异卵合条件变分自编码器(DCVAE),用于少样本学习。DCVAE通过将两个条件变分自编码器(CVAE)以共生方式配对,共享随机种子但分别以不同模态(如视觉和语义)作为条件,自适应地融合两种模态的特征,生成高质量的合成样本,在 miniImageNet、CIFAR-FS 和 CUB 数据集上均实现了最先进性能,即使在部分模态缺失的情况下也表现优异。
Data augmentation is a powerful technique for improving the performance of the few-shot classification task. It generates more samples as supplements, and then this task can be transformed into a common supervised learning issue for solution. However, most mainstream data augmentation based approaches only consider the single modality information, which leads to the low diversity and quality of generated features. In this paper, we present a novel multi-modal data augmentation approach named Dizygotic Conditional Variational AutoEncoder (DCVAE) for addressing the aforementioned issue. DCVAE conducts feature synthesis via pairing two Conditional Variational AutoEncoders (CVAEs) with the same seed but different modality conditions in a dizygotic symbiosis manner. Subsequently, the generated features of two CVAEs are adaptively combined to yield the final feature, which can be converted back into its paired conditions while ensuring these conditions are consistent with the original conditions not only in representation but also in function. DCVAE essentially provides a new idea of data augmentation in various multi-modal scenarios by exploiting the complement of different modality prior information. Extensive experimental results demonstrate our work achieves state-of-the-art performances on miniImageNet, CIFAR-FS and CUB datasets, and is able to work well in the partial modality absence case.
研究动机与目标
- 为解决少样本学习中单模态数据增强的局限性,即生成特征缺乏多样性与先验知识。
- 通过利用视觉与语义模态信息的互补性,提升低数据场景下的特征质量与泛化能力。
- 构建一个稳健的框架,确保原始条件与生成条件在表征与功能上保持一致性。
- 在具有挑战性的数据配置下实现有效的少样本学习,包括模态部分缺失与跨模态场景。
- 提出一种新型的生成学习范式,用于多模态数据合成,其性能优于单模态方法与简单的多模态融合方法。
提出的方法
- DCVAE 采用两个条件变分自编码器(CVAE),使用相同的随机种子但分别以不同模态(视觉与语义)作为条件,形成异卵共生结构。
- 每个 CVAE 生成以各自模态为条件的合成特征:一个以视觉输入为条件,另一个以语义描述为条件。
- 通过一种自适应混合机制,将两个生成的特征融合为最终的混合合成特征,其权重由网络学习以平衡各模态的贡献。
- 条件循环一致性模块确保最终的合成特征能以高保真度重建原始的两种条件(视觉与语义),在表征与功能一致性上均表现良好。
- 模型通过端到端训练,损失函数结合了重建损失、KL 散度损失与循环一致性损失,以强制对齐原始条件与生成条件。
- 该框架在多种模态配置下的标准少样本基准上进行了评估,包括全模态、单模态与部分模态缺失的情况。
实验结果
研究问题
- RQ1具有共享随机性但不同模态条件的双条件 CVAE 架构,是否能提升少样本学习中特征的多样性与质量?
- RQ2与单模态或基于简单拼接的多模态条件相比,多模态特征的自适应融合在少样本分类中表现如何?
- RQ3在部分模态缺失(如推理时缺失视觉或语义输入)的情况下,所提方法的泛化能力有多强?
- RQ4循环一致性模块是否能有效保持原始条件与生成条件之间在功能与表征上的一致性?
- RQ5所提方法是否能在包括 miniImageNet、CIFAR-FS 与 CUB 在内的多个少样本学习基准上实现最先进性能?
主要发现
- DCVAE 在 miniImageNet、CIFAR-FS 与 CUB 数据集上均实现了最先进性能,无论在全模态还是部分模态设置下均优于现有方法。
- 在 5 类 1 样本学习设置下,语义条件 CVAE 生成的特征比单模态 CVAE 准确率高出 1.69%,凸显了语义信息在低样本场景中的重要性。
- 在相同 5 类 1 样本设置下,视觉条件 CVAE 的准确率相比单模态 CVAE 提升了 5.90%,证明了多模态条件的优越性。
- 混合合成特征 $\hat{x}$ 达到了最高准确率,且 $x_s + \hat{x}$ 的组合比 $x_v + \hat{x}$ 提升了 0.72%,表明语义特征在一次学习中更具影响力。
- 在所有模态设置下,DCVAE 生成的特征中心与真实原型之间的平均欧氏距离均低于 CVAE,证实了其更优的特征泛化能力。
- 循环一致性模块确保最终的合成特征能以高保真度重建原始视觉与语义条件,验证了模型在一致性和鲁棒性方面的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。