[论文解读] Latent Normalizing Flows for Many-to-Many Cross-Domain Mappings
该论文提出LNFMM,一种半监督框架,通过使用归一化流在独立的潜在空间中建模共享信息与领域特定信息,从而实现在图像与文本之间的多样化、多对多跨域映射。通过利用归一化流学习数据相关先验,该模型在图像字幕生成(Bleu、CIDEr)和文本到图像生成(IvOM、LPIPS)方面均达到最先进性能,其在准确率和多样性方面均优于先前方法。
Learned joint representations of images and text form the backbone of several important cross-domain tasks such as image captioning. Prior work mostly maps both domains into a common latent representation in a purely supervised fashion. This is rather restrictive, however, as the two domains follow distinct generative processes. Therefore, we propose a novel semi-supervised framework, which models shared information between domains and domain-specific information separately. The information shared between the domains is aligned with an invertible neural network. Our model integrates normalizing flow-based priors for the domain-specific information, which allows us to learn diverse many-to-many mappings between the two domains. We demonstrate the effectiveness of our model on diverse tasks, including image captioning and text-to-image synthesis.
研究动机与目标
- 为解决现有模型在潜在空间中强制使用高斯先验所导致的后验坍缩及跨域生成多样性降低的问题。
- 通过保留领域特定变化并对齐共享语义信息,实现在图像与文本之间的多对多映射。
- 在潜在空间中学习复杂、多模态的联合分布,而无需额外的聚类或风格监督。
- 通过利用归一化流建模数据相关先验,提升图像字幕生成与文本到图像生成在准确率与多样性方面的表现。
提出的方法
- 该模型将潜在空间划分为共享(语义)和领域特定两部分,其中共享维度由配对的图像-文本数据学习得到。
- 通过在残差潜在维度上应用归一化流来建模领域特定变化,从而实现复杂、数据相关的先验。
- 可逆的归一化流层支持精确的似然计算与高效采样,适用于生成与推理。
- 该框架将条件变分自编码器与归一化流先验相结合,支持从配对数据和未配对数据中进行半监督学习。
- 在图像解码器中引入判别器,以在不改变联合潜在空间的前提下提升文本到图像生成的图像质量。
- 该架构支持双向生成:从图像到文本与从文本到图像,其多样化输出得益于灵活的先验。
实验结果
研究问题
- RQ1归一化流能否有效建模潜在空间中复杂、多模态的联合分布,以实现图像-文本跨域生成?
- RQ2与高斯先验相比,通过归一化流学习数据相关先验在图像字幕生成中如何提升多样性与准确率?
- RQ3在无需额外监督的情况下,具有共享与领域特定潜在空间的半监督框架在多对多映射中能达到何种程度?
- RQ4所提出的方法在图像字幕生成与文本到图像生成任务中,是否在多样性与保真度方面均优于最先进模型?
主要发现
- 在 COCO 数据集上,LNFMM 在图像字幕生成任务中达到最先进性能,CIDEr 得分为 128.7,Bleu-4 得分为 86.3,优于先前方法。
- 在文本到图像生成中,模型将 IvOM 得分提升至 0.430,LPIPS 得分为 0.481,表明其生成结果在多样性与与真实图像的感知相似性方面优于 AttnGAN。
- LNFMM 的 Inception Score 达到 12.10 ± 0.18,超过 HD-GAN(11.86),且无需额外监督。
- 定性结果表明,生成的字幕在语义与句法上具有多样性,生成的图像也具有多样性且语义准确,包括特写与不同物体朝向。
- 该模型在不依赖风格或对象级聚类引导监督的情况下,仍能生成高质量、多样化的样本。
- 使用归一化流有效建模了复杂、多模态的先验,避免了后验坍缩,实现了高保真度与多样化的生成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。