[论文解读] Image-to-image translation for cross-domain disentanglement
本文提出跨域解耦,分离图像表示中的共享因素和域专属因素,实现双向多模态图像翻译和跨域检索无需标签,在挑战性数据集上对比最新基线取得改进。
Deep image translation methods have recently shown excellent results, outputting high-quality images covering multiple modes of the data distribution. There has also been increased interest in disentangling the internal representations learned by deep methods to further improve their performance and achieve a finer control. In this paper, we bridge these two objectives and introduce the concept of cross-domain disentanglement. We aim to separate the internal representation into three parts. The shared part contains information for both domains. The exclusive parts, on the other hand, contain only factors of variation that are particular to each domain. We achieve this through bidirectional image translation based on Generative Adversarial Networks and cross-domain autoencoders, a novel network component. Our model offers multiple advantages. We can output diverse samples covering multiple modes of the distributions of both domains, perform domain-specific image transfer and interpolation, and cross-domain retrieval without the need of labeled data, only paired images. We compare our model to the state-of-the-art in multi-modal image translation and achieve better results for translation on challenging datasets as well as for cross-domain retrieval on realistic datasets.
研究动机与目标
- 动机:将潜在表示解耦以分离域共享和域专属因素。
- 开发一个双向图像翻译框架,强制三部分表示(共享、X专属、Y专属)。
- 通过跨域自编码器和基于GRL的约束,实现多样化的多模态翻译和跨域检索。
- 证明解耦后的表示支持域特定转移、插值和视觉类比,而无需标注数据。
- 在 MNIST 变体及更复杂的数据集上进行评估,以展示相对于最先进的多模态翻译方法的优势。
提出的方法
- 将潜在编码分成每个域的共享 S 与专属 E 部分(E^X, E^Y),以及一个对域不变的共享分量 S^{X} / S^{Y}。
- 使用基于双向 GAN 的翻译器 G 和 F,拥有在 (S,E) 上工作的编码器/解码器,但生成图像仅使用共享部分 S 和专属部分的随机噪声 z。
- 对一个试图从专属特征重建目标域的小解码器应用梯度反转层(GRL),以抑制域特异性泄漏。
- 通过 L1 损失并加入受控噪声,强制跨域的共享表示相似性,避免坍塌(S^X ≈ S^Y,同时注入噪声防止简单解)。
- 引入跨域自编码器,通过从同域共享与跨域专属分量的混合中重建输入来对齐潜在空间。
- 使用 WGAN-GP 损失以提高稳定性,并结合基于重构的自编码器损失以保持跨翻译的一致性。
实验结果
研究问题
- RQ1三部分潜在表示(共享、X 专属、Y 专属)在分离域变因素的同时,是否能实现跨域翻译?
- RQ2跨域自编码和基于 GRL 的约束是否在无需标注数据的情况下提升多模态翻译和跨域检索?
- RQ3所提出的表示如何支持样本多样性、域特定转移以及跨两个域的插值?
- RQ4模型是否能够仅使用成对数据实现有效的跨域检索和视觉类比?
- RQ5消融实验是否显示跨域自编码器、GRL 以及对共享特征的 L1 一致性是必要的?
主要发现
- 通过在固定共享部分的同时改变专属噪声 z,模型能够产生多样化的多模态翻译。
- 使用共享特征的跨域检索达到很高的 Recall@1,超越基于像素的基线,并实现无标签学习。
- 通过操作共享和专属分量,能够实现视觉类比和域特定插值,通常无需显式监督。
- 消融结果表明跨域自编码器和 GRL 对解耦和翻译质量有显著贡献;移除它们会降低性能。
- 该方法可扩展到真实数据集(地图/卫星、外观/地图),在汽车和椅子数据集的双向翻译中达到具有竞争力的 LPIPS 分数。
- 与 BicycleGAN 和 pix2pix 基线相比,所提出的方法在感知质量和模式多样性方面表现更好,尤其是在处理显著结构变化时。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。