Skip to main content
QUICK REVIEW

[论文解读] Discriminative Region Proposal Adversarial Networks for High-Quality Image-to-Image Translation

Chao Wang, Haiyong Zheng|arXiv (Cornell University)|Nov 27, 2017
Generative Adversarial Networks and Image Synthesis参考文献 42被引用 12
一句话总结

该论文提出了一种基于生成对抗网络的新型框架——判别性区域提议对抗网络(DRPAN),用于高质量的图像到图像翻译。该框架通过判别性区域提议网络和专用修正模块,迭代识别并优化最不真实的图像区域。通过将对抗训练聚焦于最易产生伪影的区域,DRPAN在多个基准测试(包括Cityscapes、Zappos50k和边缘到图像任务)中实现了最先进的逼真度与细节保真度表现。

ABSTRACT

Image-to-image translation has been made much progress with embracing Generative Adversarial Networks (GANs). However, it's still very challenging for translation tasks that require high quality, especially at high-resolution and photorealism. In this paper, we present Discriminative Region Proposal Adversarial Networks (DRPAN) for high-quality image-to-image translation. We decompose the procedure of image-to-image translation task into three iterated steps, first is to generate an image with global structure but some local artifacts (via GAN), second is using our DRPnet to propose the most fake region from the generated image, and third is to implement "image inpainting" on the most fake region for more realistic result through a reviser, so that the system (DRPAN) can be gradually optimized to synthesize images with more attention on the most artifact local part. Experiments on a variety of image-to-image translation tasks and datasets validate that our method outperforms state-of-the-arts for producing high-quality translation results in terms of both human perceptual studies and automatic quantitative measures.

研究动机与目标

  • 解决基于生成对抗网络的图像到图像翻译中长期存在的局部伪影与模糊细节问题,尤其是在高分辨率场景下。
  • 克服标准局部块判别器在引导生成器对最 problematic 局部区域进行优化时的局限性。
  • 通过引入一个迭代反馈机制,持续定位并修正最虚假的图像区域,从而提升逼真度与结构保真度。
  • 开发一个可泛化的框架,适用于多种图像翻译任务,包括语义分割到照片、草图到图像以及边缘到图像等。
  • 通过结合判别性区域提议与专用修正网络,同时提升自动评估指标与人类感知评价表现。

提出的方法

  • 将图像翻译分解为三个迭代步骤:(1) 生成器生成具有全局结构但存在局部伪影的图像;(2) DRPnet 通过滑动窗口机制对局部块进行判别性评分,识别出最不真实的区域;(3) 修正网络执行局部图像修复,以优化最不真实的区域。
  • 设计一种局部块判别器,生成判别性得分图,突出显示高伪造概率区域,实现对伪影的精确定位。
  • 引入一个修正网络,用于区分真实图像与掩码后的虚假区域(即真实图像中将最不真实区域替换为生成区域),为生成器提供针对性反馈。
  • 采用加权损失函数,结合局部块判别器与修正网络的损失,平衡全局与局部优化,适应不同任务需求。
  • 在端到端的 GAN 训练循环中应用该框架,其中生成器基于全局对抗损失与来自修正网络的局部反馈进行更新。
  • 利用掩码后的真实图像(即真实图像中将最不真实区域替换为生成区域)作为修正网络的负样本,实现对问题区域的聚焦优化。

实验结果

研究问题

  • RQ1判别性区域提议机制是否能有效提升基于 GAN 的图像到图像翻译中伪影的定位精度?
  • RQ2引入一个专注于优化最不真实区域的专用修正网络,是否能显著提升生成图像的感知质量,优于标准 GAN 模型?
  • RQ3对最虚假区域进行迭代优化,是否能显著提升定量指标(如 IoU、准确率)与人类感知评分?
  • RQ4DRPAN 在多种图像翻译任务(包括语义分割到照片、草图到图像、边缘到图像)中的表现如何?
  • RQ5与 SOTA 模型(如 Pix2pix 和 CRN)相比,该方法是否能在保持高分辨率输出的同时,实现更高的逼真度与更低的模糊度?

主要发现

  • 在 Cityscapes 数据集上,DRPAN 实现了 88% 的像素级准确率、52% 的类别准确率与 43% 的类别 IoU,优于 Pix2pix(83%、36%、29%)与 L1+U-Net(86%、42%、35%)的定量指标。
  • 在人类感知评估中,18.2% 的参与者将 DRPAN 生成的图像判定为真实图像,显著优于 Pix2pix(5.3%)、StackGAN 类似模型(6.8%)与 CRN(9.4%)。
  • 在地图到航拍图像任务中,DRPAN 成功让 33.4% 的 Turkers 误认为生成图像为真实图像,高于 Pix2pix 的 25.2% 与 CycleGAN 的 26.8%。
  • 在边缘到图像与草图到图像任务中,DRPAN 生成的图像在清晰度与真实感方面优于 Pix2pix,尤其在稀疏或模糊输入下表现更优。
  • 消融实验证明,移除虚假区域掩码机制会显著降低性能,验证了修正网络在局部伪影优化中的关键作用。
  • 在成对人类比较中,DRPAN 在感知真实度方面得分最高:在语义到照片任务中,91.2% 的参与者更偏好 DRPAN 而非 Pix2pix,84.6% 更偏好 DRPAN 而非 StackGAN 类似模型,75.7% 更偏好 DRPAN 而非 CRN。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。