Skip to main content
QUICK REVIEW

[论文解读] CoCosNet v2: Full-Resolution Correspondence Learning for Image Translation

Xingran Zhou, Bo Zhang|arXiv (Cornell University)|Dec 3, 2020
Generative Adversarial Networks and Image Synthesis参考文献 57被引用 5
一句话总结

CoCosNet v2 提出了一种分层的、可微的、基于GRU增强的PatchMatch框架,用于图像翻译中的全分辨率跨域对应学习,通过端到端无监督训练利用细粒度样本细节,在512×512和1024×1024分辨率下实现高保真、照片级真实的生成结果。

ABSTRACT

We present the full-resolution correspondence learning for cross-domain images, which aids image translation. We adopt a hierarchical strategy that uses the correspondence from coarse level to guide the fine levels. At each hierarchy, the correspondence can be efficiently computed via PatchMatch that iteratively leverages the matchings from the neighborhood. Within each PatchMatch iteration, the ConvGRU module is employed to refine the current correspondence considering not only the matchings of larger context but also the historic estimates. The proposed CoCosNet v2, a GRU-assisted PatchMatch approach, is fully differentiable and highly efficient. When jointly trained with image translation, full-resolution semantic correspondence can be established in an unsupervised manner, which in turn facilitates the exemplar-based image translation. Experiments on diverse translation tasks show that CoCosNet v2 performs considerably better than state-of-the-art literature on producing high-resolution images.

研究动机与目标

  • 为解决在高分辨率图像翻译中保持细粒度纹理的挑战,通过学习源图像与样本图像之间的全分辨率语义对应关系。
  • 通过引入分层策略与GRU辅助优化,克服直接在深度网络中应用PatchMatch时的低效与不稳定问题。
  • 实现对应关系与翻译网络的端到端无监督训练,使模型能够从原始图像对中学习,而无需真实对应关系监督。
  • 通过在对应关系估计过程中实现更大上下文的梯度流动,改善特征学习,减少训练初期的混沌动态。

提出的方法

  • 采用分层策略,在粗粒度层级(如64×64)初始化对应关系,并在更精细的尺度(128×128、256×256、512×512)上逐步优化,利用粗粒度匹配结果引导细粒度搜索。
  • 引入GRU辅助的PatchMatch模块,在每次迭代中通过聚合邻近补丁与历史估计信息来优化对应关系,提升上下文感知能力与收敛性。
  • 通过K=16个最近邻的平均实现软匹配,确保可微性,从而支持通过对应模块的反向传播。
  • 应用几何数据增强(翻转、随机裁剪、仿射变换)生成伪样本,提升无监督训练中的泛化能力。
  • 将学习到的对应关系整合到翻译网络中,对样本特征在多尺度下进行特征扭曲,随后通过自适应归一化进行特征拼接与调制,实现风格迁移。
  • 以端到端无监督方式联合训练整个系统,通过对抗损失与循环一致性损失联合优化对应关系与图像翻译网络。

实验结果

研究问题

  • RQ1能否以端到端、可微且高效的方式学习全分辨率跨域对应关系,以支持高分辨率图像翻译?
  • RQ2与标准PatchMatch相比,引入分层GRU增强的PatchMatch策略在深度网络中如何提升对应质量与训练稳定性?
  • RQ3全分辨率对应学习在512×512和1024×1024分辨率下,对样本图像翻译中的纹理保真度与视觉真实感提升程度如何?
  • RQ4通过可微PatchMatch实现的无监督对应学习,能否在无真实监督的情况下有效引导特征调制?
  • RQ5将多尺度扭曲样本特征与GRU优化的对应关系结合,如何在保持局部细节的同时提升风格迁移性能?

主要发现

  • CoCosNet v2 在样本图像驱动的图像翻译任务中达到最先进性能,在512×512和1024×1024分辨率下生成照片级真实结果。
  • 与先前方法相比,该模型生成的输出在视觉质量上更优,纹理更加精细,因为全分辨率对应关系使得样本中的局部细节得以精确传递。
  • 分层GRU增强的PatchMatch方法通过结合局部邻域信息与历史对应估计,有效降低训练不稳定性并提升收敛性。
  • 该方法完全可微且无监督,支持在无需真实对应关系监督的情况下,联合训练对应关系与翻译网络。
  • 单张512×512图像的推理时间约为0.6秒,尽管分辨率较高,仍表现出实际可用的效率。
  • 在定量指标与定性评估中,该方法均优于现有最先进方法,尤其在保持细粒度纹理与结构细节方面表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。