[论文解读] MISO: Mutual Information Loss with Stochastic Style Representations for Multimodal Image-to-Image Translation
该论文提出MISO,一种新颖的无配对多模态图像到图像翻译模型,通过将内容特征基于风格表征进行条件化,并引入基于互信息的随机损失函数MILO,从而提升图像质量和多样性。MISO通过将潜在变量建模为随机变量并强制分布一致性,在多个数据集上实现了最先进性能。
Unpaired multimodal image-to-image translation is a task of translating a given image in a source domain into diverse images in the target domain, overcoming the limitation of one-to-one mapping. Existing multimodal translation models are mainly based on the disentangled representations with an image reconstruction loss. We propose two approaches to improve multimodal translation quality. First, we use a content representation from the source domain conditioned on a style representation from the target domain. Second, rather than using a typical image reconstruction loss, we design MILO (Mutual Information LOss), a new stochastically-defined loss function based on information theory. This loss function directly reflects the interpretation of latent variables as a random variable. We show that our proposed model Mutual Information with StOchastic Style Representation(MISO) achieves state-of-the-art performance through extensive experiments on various real-world datasets.
研究动机与目标
- 解决现有无配对多模态图像到图像翻译模型依赖确定性重建损失以及内容与风格独立解耦所带来的局限性。
- 通过将内容与风格之间的关系建模为分层结构(内容为基底,风格为条件修饰),提升翻译过程中的图像质量与多样性。
- 用一种基于信息论的新损失函数替代标准的自重建损失,该损失函数将潜在变量视为随机变量。
- 在不牺牲真实感的前提下,实现更好的内容保留与更高的图像生成多样性。
提出的方法
- 引入一个条件编码器,从源图像生成内容特征,同时基于目标域的风格特征进行条件化。
- 提出MILO(互信息损失),一种基于潜在变量与重建图像之间互信息的随机损失函数,替代标准的L1自重建损失。
- 采用类似于BicycleGAN的两阶段训练策略(IFI与FIF),但结合条件化内容表征与MILO损失,以提升解耦效果与多样性。
- 将潜在变量建模为服从𝒩(0, I)分布的随机变量,通过分布对齐实现更好的泛化性与多样性。
- 采用变分信息最大化方法估计损失函数中的互信息,从而实现端到端训练并保持梯度稳定。
- 用MILO替代标准自重建损失,以促使模型学习到有意义、多样化且真实感强的图像分布。
实验结果
研究问题
- RQ1与独立解耦相比,将内容特征基于风格表征进行条件化是否能提升多模态图像翻译的质量与多样性?
- RQ2与将潜在变量视为确定性值相比,将其建模为随机变量是否能带来更好的泛化性与多样性?
- RQ3基于互信息的损失函数(MILO)是否能在无配对多模态翻译中超越标准自重建损失?
- RQ4在edges2shoes、cityscapes和monstercat等多样化数据集上,所提模型在内容保留与多样性方面表现如何?
- RQ5分层的内容-风格关系在人脸与艺术图像翻译中在多大程度上减少了伪影并提升了真实感?
主要发现
- MISO在多个数据集(包括edges2shoes、cityscapes和monstercat)上实现了最先进性能,且在多样性和真实感评分上均最高。
- 在monstercat数据集上,MISO在上界条件下实现了O↔O多样性得分为0.98,显著优于MUNIT(0.92)和SRSO(0.90),同时保持较低的I↔O距离(0.41)。
- 在人脸翻译(男↔女)任务中,MISO在两个方向的错误率均低于1%,优于DRIT与MUNIT,后者在女→男翻译中表现出较高的失败率。
- 定性结果表明,MISO能有效保留细粒度细节,如树木结构、地面纹理以及发丝与妆容等面部特征,同时生成多样且逼真的输出。
- 采用MILO损失的模型(MISO)在清晰度与多样性方面均优于SRSO(使用SR损失),尤其在发丝与面部细节方面表现更优,证明了随机损失的优越性。
- 潜在空间可视化结果表明,MISO学习到了有意义、解耦良好且结构清晰的分布,避免了记忆化现象,支持对未见潜在码的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。