Skip to main content
QUICK REVIEW

[论文解读] PixelNN: Example-based Image Synthesis

Aayush Bansal, Yaser Sheikh|arXiv (Cornell University)|Aug 17, 2017
Generative Adversarial Networks and Image Synthesis参考文献 43被引用 6
一句话总结

PixelNN 提出了一种两阶段图像生成方法,通过结合基于 CNN 的回归器与逐像素最近邻匹配,从不完整的输入(如低分辨率图像、边缘图或法线图)生成多样、高频、逼真的图像。通过利用深度特征描述符进行局部像素匹配,该方法克服了 GAN 中的模式崩溃问题,并实现了可控、可解释的生成,每个输入可生成多个合理的输出。

ABSTRACT

We present a simple nearest-neighbor (NN) approach that synthesizes high-frequency photorealistic images from an "incomplete" signal such as a low-resolution image, a surface normal map, or edges. Current state-of-the-art deep generative models designed for such conditional image synthesis lack two important things: (1) they are unable to generate a large set of diverse outputs, due to the mode collapse problem. (2) they are not interpretable, making it difficult to control the synthesized output. We demonstrate that NN approaches potentially address such limitations, but suffer in accuracy on small datasets. We design a simple pipeline that combines the best of both worlds: the first stage uses a convolutional neural network (CNN) to maps the input to a (overly-smoothed) image, and the second stage uses a pixel-wise nearest neighbor method to map the smoothed output to multiple high-quality, high-frequency outputs in a controllable manner. We demonstrate our approach for various input modalities, and for various domains ranging from human faces to cats-and-dogs to shoes and handbags.

研究动机与目标

  • 解决条件 GAN 中的模式崩溃问题,以提升生成输出的多样性。
  • 通过在运行时对训练集进行剪枝,实现对图像生成过程的用户控制。
  • 通过使用非参数化的最近邻匹配,克服深度生成模型缺乏可解释性的缺陷。
  • 通过使用局部像素组合而非全局图像匹配,提升小样本数据集上的泛化能力。
  • 从不完整的信号(如边缘图、低分辨率图像和法线图)生成高频、逼真的输出。

提出的方法

  • 训练一个 CNN,从不完整输入(如低分辨率图像或边缘图)回归出单一、平滑的输出。
  • 使用多尺度描述符从 CNN 输出中提取深度特征,以捕捉局部上下文信息,支持逐像素匹配。
  • 利用深度特征描述符在训练集中执行逐像素最近邻搜索,以找到最相似的图像块。
  • 通过从最近邻训练样本中复制并粘贴对应像素,组合生成最终的高频输出。
  • 通过筛选训练集,仅保留符合用户指定条件(如特定猫品种)的样本,实现可控生成。
  • 利用训练图像与生成输出之间的密集像素级对应关系,支持标签迁移或后续分析。

实验结果

研究问题

  • RQ1非参数化的最近邻方法是否能在不出现模式崩溃的情况下,从不完整输入生成多样、高频、逼真的图像?
  • RQ2与全局图像匹配相比,使用深度特征的逐像素组合是否能提升泛化能力和表征能力?
  • RQ3与端到端的深度生成模型相比,最近邻匹配在图像生成中能提供多大程度的可解释性与用户控制?
  • RQ4在边缘和法线估计保真度方面,基于最近邻的生成方法与当前最先进的 GAN 方法相比,其性能在定量上如何?
  • RQ5该方法生成的密集像素对应关系是否能支持下游任务(如语义标签迁移)?

主要发现

  • PixelNN 每个输入可生成多个多样且高质量的输出,在多样性方面显著优于基于 GAN 的基线模型,如在 72 次运行中从随机选择到最优选择的性能提升所示。
  • 在表面法线估计的定量评估中,PixelNN 实现了 12.3° 的平均角度误差和 9.1° 的中位数误差,且 87.5% 的像素误差在 30° 以内,优于基线模型 Pix-to-Pix。
  • 在边缘检测方面,PixelNN 的平均精度(AP)达到 0.89,与真实图像性能相当,显著优于基线模型。
  • 该方法支持可控生成:用户可通过筛选训练集,将输出引导至特定风格(如特定猫品种),展示了直观的用户控制能力。
  • 当不存在合适的最近邻时会出现失败案例,凸显了对高效搜索优化的需求,该问题可通过类似 Scanner 的系统解决。
  • 该方法天然生成训练图像与生成输出之间的密集像素级对应关系,为标签迁移和图像分析等潜在应用提供了支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。