[论文解读] CDVAE: Co-embedding Deep Variational Auto Encoder for Conditional Variational Generation
本文提出CDVAE,一种共嵌入深度变分自编码器,通过在潜在代码空间施加度量约束,防止条件变分生成中的代码空间坍缩。通过引导模型在代码空间中保持输入相似性,并结合混合密度网络实现多模态输出,CDVAE在图像布光重制与色彩重饱和任务中实现了更优的多样性与质量,其在定量与定性评估中均优于强基线模型。
Problems such as predicting a new shading field (Y) for an image (X) are ambiguous: many very distinct solutions are good. Representing this ambiguity requires building a conditional model P(Y|X) of the prediction, conditioned on the image. Such a model is difficult to train, because we do not usually have training data containing many different shadings for the same image. As a result, we need different training examples to share data to produce good models. This presents a danger we call "code space collapse" - the training procedure produces a model that has a very good loss score, but which represents the conditional distribution poorly. We demonstrate an improved method for building conditional models by exploiting a metric constraint on training data that prevents code space collapse. We demonstrate our model on two example tasks using real data: image saturation adjustment, image relighting. We describe quantitative metrics to evaluate ambiguous generation results. Our results quantitatively and qualitatively outperform different strong baselines.
研究动机与目标
- 为解决视觉任务中训练数据零散且单个输入缺乏多个输出时学习多模态条件分布的挑战。
- 识别并缓解条件VAE中的“代码空间坍缩”——一种失败模式,即模型忽略潜在变量,导致输出多样性低。
- 通过强制相似输入生成相似代码、不相似输入生成不相似代码,提升条件生成的泛化能力与多样性。
- 开发一种方法,即使在配对训练数据有限的情况下,也能基于输入图像高质量、多样化地生成空间场(如阴影、饱和度)
提出的方法
- CDVAE引入一种度量约束,促使代码空间保留输入相似性:相似输入映射到相似代码,不相似输入映射到不相似代码。
- 模型使用深度编码器从输入图像 $ X $ 生成代码 $ c(x) $,该代码随后作为输入送入混合密度网络(MDN)以建模多模态输出 $ Y $。
- MDN组件通过预测高斯混合模型的参数(均值、方差、权重)显式建模条件分布 $ P(Y|X) $,从而实现多样化且结构化的输出。
- 重建损失确保输出与真实值的保真度,而KL散度项则将潜在代码分布正则化为标准正态分布。
- 度量约束以对比损失的形式实现,即拉近相似输入的代码,推开不相似输入的代码。
- 模型通过反向传播端到端训练,度量约束有效防止网络因相似输入而坍缩为单一代码。
实验结果
研究问题
- RQ1能否通过防止代码空间坍缩,使条件变分自编码器在零散训练数据下更具鲁棒性?
- RQ2在模糊视觉任务中,对代码空间施加度量约束如何提升条件生成的多样性与质量?
- RQ3对相似输入强制代码相似性在多大程度上能增强图像布光重制与色彩重饱和任务中的泛化能力并减少伪影?
- RQ4结合度量约束代码空间与混合密度网络是否能实现比标准CVAE或GAN方法更优的多模态建模?
主要发现
- 在图像布光重制与色彩重饱和任务中,CDVAE在所有样本数量下均达到最低的与真实值的误差,100个样本时误差分别为1.11与3.82(×10⁻²)。
- CDVAE在100次采样下的预测方差始终较低(布光重制为1.77,色彩重饱和为3.55),显著低于CVAE(0.19与1.20),表明其具有更好的多样性与更低的模式坍缩风险。
- 定性结果表明,CVAE与CGAN存在模式坍缩,输出多样性低且含有伪影,而CDVAE生成的结果更具多样性、空间一致性更强且更逼真。
- 消融研究显示,若移除嵌入引导,生成结果多样性降低且伪影增多,证实度量约束在保持代码空间结构中的关键作用。
- CDVAE使用12维嵌入(CDVAE12)在误差与方差之间实现了最佳平衡,在所有指标上均优于CVAE与基线GAN模型。
- 该模型对输入扰动表现出鲁棒性,能保持一致的输出多样性;而代码坍缩的模型则在输入微小变化下产生不稳定或完全相同的输出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。