Skip to main content
QUICK REVIEW

[论文解读] Optimal Unsupervised Domain Translation

Emmanuel de Bézenac, Ibrahim Ayed|arXiv (Cornell University)|Jun 4, 2019
Generative Adversarial Networks and Image Synthesis参考文献 30被引用 13
一句话总结

本文提出动态最优神经翻译(DONT),一种新颖的框架,将无监督域翻译建模为最优传输问题,确保所学映射的存在性与唯一性。通过将传输过程建模为具有可学习向量场的动力系统,DONT 实现了平滑插值并显式控制语义内容,在图像翻译任务中,其理论与实践表现均优于 CycleGAN 等先前方法。

ABSTRACT

Domain Translation is the problem of finding a meaningful correspondence between two domains. Since in a majority of settings paired supervision is not available, much work focuses on Unsupervised Domain Translation (UDT) where data samples from each domain are unpaired. Following the seminal work of CycleGAN for UDT, many variants and extensions of this model have been proposed. However, there is still little theoretical understanding behind their success. We observe that these methods yield solutions which are approximately minimal w.r.t. a given transportation cost, leading us to reformulate the problem in the Optimal Transport (OT) framework. This viewpoint gives us a new perspective on Unsupervised Domain Translation and allows us to prove the existence and uniqueness of the retrieved mapping, given a large family of transport costs. We then propose a novel framework to efficiently compute optimal mappings in a dynamical setting. We show that it generalizes previous methods and enables a more explicit control over the computed optimal mapping. It also provides smooth interpolations between the two domains. Experiments on toy and real world datasets illustrate the behavior of our method.

研究动机与目标

  • 为解决如 CycleGAN 等无监督域翻译(UDT)方法缺乏理论基础的问题,这些方法常因配对不明确而导致病态解。
  • 通过引入显式运输成本,将 UDT 形式化为具有良好适定性的最优传输(OT)问题,确保解的存在性与唯一性。
  • 开发一种实用的、可微分的框架,实现在动力学设置下高效计算最优映射。
  • 提供对语义内容的显式控制,并实现域之间的平滑插值。
  • 证明在该框架下训练的神经网络可学习到有意义、最小且一致的映射,而无需成对数据。

提出的方法

  • 通过在时间离散化框架中将映射建模为由可学习向量场控制的若干小步,将 UDT 重新表述为动力学最优传输问题。
  • 使用参数为 θ_k 的神经网络在每个时间步参数化向量场,通过随机梯度下降实现端到端训练。
  • 采用离散优化问题,最小化向量场的 p-范数,同时通过拉格朗日惩罚项对推送前分布施加一致性约束。
  • 通过差异损失 D 实现目标域一致性约束(T_♯α = β),该损失可基于 GAN、核距离或基于 OT 的度量。
  • 通过反转前向轨迹计算实现逆映射,无需重新训练即可实现双向翻译。
  • 在语义嵌入空间(例如通过预训练自编码器获得)中应用该方法,使运输成本具有意义并保留语义内容。

实验结果

研究问题

  • RQ1为何现有无监督域翻译模型(如 CycleGAN)尽管在理论上病态,却仍能良好泛化?
  • RQ2我们能否将 UDT 形式化为具有存在性与唯一性保证的良好适定最优传输问题?
  • RQ3如何在具有平滑插值能力的深度学习框架中高效计算最优传输映射?
  • RQ4通过引入原则性成本函数,能否实现对语义内容与映射质量的更好控制?
  • RQ5最优传输的动力学表述是否能提升图像翻译任务中的泛化能力与插值性能?

主要发现

  • 所提出的 DONT 框架确保了对一大类成本函数,最优传输映射的存在性与唯一性,解决了先前 UDT 方法的病态性问题。
  • 在 MNIST 与 CelebA 上的实验表明,DONT 学习到的映射比 CycleGAN 更具一致性与语义意义,且域间插值路径清晰。
  • 该方法可通过前向网络的中间层实现源域与目标域之间的平滑、连续插值。
  • 通过简单反转前向轨迹即可获得逆映射,无需额外训练或架构设计。
  • 当应用于语义嵌入空间(如 ResNet 特征)时,运输成本变得有意义,可在翻译过程中保留高层语义。
  • 使用逐渐减小的 λ_i 的拉格朗日惩罚,确保在优化过程中满足一致性约束,从而实现精确的域到域映射。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。