[论文解读] Emerging Disentanglement in Auto-Encoder Based Unsupervised Image Content Transfer
本文提出一种简单、单编码器-单解码器的自编码器架构,用于无监督图像内容迁移,通过将共享内容与特定领域内容分离,实现解耦表征。通过将源域图像的特定领域分量置零,并使用目标域的参考图像,模型能够以高保真度成功迁移眼镜或胡须等结构化属性,且在解耦性和重建质量方面优于先前方法,无需复杂的损失设计。
We study the problem of learning to map, in an unsupervised way, between domains A and B, such that the samples b in B contain all the information that exists in samples a in A and some additional information. For example, ignoring occlusions, B can be people with glasses, A people without, and the glasses, would be the added information. When mapping a sample a from the first domain to the other domain, the missing information is replicated from an independent reference sample b in B. Thus, in the above example, we can create, for every person without glasses a version with the glasses observed in any face image. Our solution employs a single two-pathway encoder and a single decoder for both domains. The common part of the two domains and the separate part are encoded as two vectors, and the separate part is fixed at zero for domain A. The loss terms are minimal and involve reconstruction losses for the two domains and a domain confusion term. Our analysis shows that under mild assumptions, this architecture, which is much simpler than the literature guided-translation methods, is enough to ensure disentanglement between the two domains. We present convincing results in a few visual domains, such as no-glasses to glasses, adding facial hair based on a reference image, etc.
研究动机与目标
- 解决目标域包含源域中不存在的额外结构化内容的无监督图像翻译问题。
- 通过使用目标域的单张参考图像,实现从域 A 到域 B 的内容迁移,确保所有新增内容均被忠实复制。
- 使用最小化架构与损失函数,实现共享内容与特定领域属性的解耦表征。
- 证明在温和假设下,解耦可自然涌现,从而无需复杂循环一致性或对抗性约束。
- 为现有依赖多网络或复杂损失项的引导式翻译方法提供更简单的替代方案。
提出的方法
- 一个共享的双路径编码器处理两个域,生成共享内容表征与特定领域表征。
- 对于所有源域样本(域 A),将特定领域分量设为零,强制实现共享内容与独特内容的解耦。
- 一个共享解码器从组合表征中重建图像,实现在两个域中的重建。
- 训练目标仅使用两个域的重建损失,以及一个领域混淆损失,以促进共享表征的学习。
- 模型执行从 A 到 B 的单向映射,利用来自 B 的参考图像注入特定领域内容。
- 该方法支持双向操作:通过解码 (e₁(b), 0) 实现从 B 到 A 的映射,以移除特定领域内容。
实验结果
研究问题
- RQ1一个具有共享编码器与解码器的最小化自编码器架构,能否在无监督图像翻译中实现解耦表征?
- RQ2对源域图像将特定领域分量置零,是否能在无显式正则化的情况下实现自然涌现的解耦?
- RQ3仅使用重建损失与领域混淆损失的简单损失函数,能否实现高质量的引导式内容迁移?
- RQ4与最先进方法相比,该模型在迁移眼镜或胡须等结构化属性方面的表现如何?
- RQ5该模型能否同时用于内容迁移(A→B)与特征移除(B→A)?与现有解耦模型相比表现如何?
主要发现
- 该模型在引导式图像翻译中达到最先进性能,定性结果表明对眼镜、胡须等结构化属性的迁移准确度高。
- 用户研究表明,在去除眼镜方面,92% 的偏好选择本方法而非 Fader 网络;在去除胡须方面为 89%;在去除微笑方面为 91%。
- 分类器结果表明,使用本方法将图像转换到域 A 后,其属于域 B 的平均概率仅为 0.011,显著低于 Fader 网络的 0.066,表明对目标域特征的去除更彻底。
- 该方法以极少的损失项实现高质量解耦,证明解耦可自然地从网络架构设计与权重共享中涌现。
- 插值实验表明,共享内容表征具有线性可插值性,支持解耦表征的线性解耦。
- 失败案例主要源于源图像或引导图像的错位,表明模型的鲁棒性依赖于图像对齐。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。