Skip to main content
QUICK REVIEW

[论文解读] On Aliased Resizing and Surprising Subtleties in GAN Evaluation

Gaurav Parmar, Richard Zhang|arXiv (Cornell University)|Apr 22, 2021
Parallel Computing and Optimization Techniques被引用 13
一句话总结

本文指出,GAN评估中常用的混叠图像缩放和JPEG压缩会显著引入FID等度量的非预期偏差,导致不一致且具有误导性的比较。作者提出Clean-FID,一种标准化实现,通过根据下采样比例动态调整预滤波器宽度并避免有损压缩,表明这些底层预处理选择可人为将FID分数提升高达1.5分,从而破坏公平的模型评估。

ABSTRACT

Metrics for evaluating generative models aim to measure the discrepancy between real and generated images. The often-used Frechet Inception Distance (FID) metric, for example, extracts "high-level" features using a deep network from the two sets. However, we find that the differences in "low-level" preprocessing, specifically image resizing and compression, can induce large variations and have unforeseen consequences. For instance, when resizing an image, e.g., with a bilinear or bicubic kernel, signal processing principles mandate adjusting prefilter width depending on the downsampling factor, to antialias to the appropriate bandwidth. However, commonly-used implementations use a fixed-width prefilter, resulting in aliasing artifacts. Such aliasing leads to corruptions in the feature extraction downstream. Next, lossy compression, such as JPEG, is commonly used to reduce the file size of an image. Although designed to minimally degrade the perceptual quality of an image, the operation also produces variations downstream. Furthermore, we show that if compression is used on real training images, FID can actually improve if the generated images are also subsequently compressed. This paper shows that choices in low-level image processing have been an underappreciated aspect of generative modeling. We identify and characterize variations in generative modeling development pipelines, provide recommendations based on signal processing principles, and release a reference implementation to facilitate future comparisons.

研究动机与目标

  • 调查低层次图像处理步骤(特别是缩放和压缩)如何影响FID、KID和IS等GAN评估度量的可靠性。
  • 识别出常用库(如PyTorch、TensorFlow)在缩放过程中应用固定宽度预滤波,导致混叠伪影,从而污染下游特征提取。
  • 证明当生成图像也经过压缩时,对真实图像进行JPEG压缩可人为提升FID分数,即使模型并未学习到压缩伪影。
  • 提出一种标准化、符合信号处理规范的评估流程,以确保GAN模型之间公平且可复现的比较。
  • 发布Clean-FID,作为参考实现,强制在FID计算中采用正确的抗混叠处理并避免有损压缩。

提出的方法

  • 提出一种符合信号处理规范的缩放方法,根据下采样因子动态调整预滤波器核宽度,防止混叠。
  • 实现Clean-FID作为库,强制在所有缩放步骤中(数据预处理、FID计算、生成图像缩放)使用正确的抗混叠处理。
  • 使用标准图像处理库(如PIL)配合自适应滤波器进行缩放,与PyTorch和TensorFlow中使用的固定宽度双线性/双三次滤波器形成对比。
  • 在不同质量级别下对真实图像和生成图像施加受控的JPEG压缩,以测量其对FID和KID分数的影响。
  • 通过比较不同模型检查点和训练协议在混叠与抗混叠缩放下的FID分数,评估模型选择偏差。
  • 预先计算并发布常见数据集(如FFHQ、LSUN)的Inception特征统计量,以支持使用Clean-FID的一致评估。

实验结果

研究问题

  • RQ1不同图像缩放实现方式(尤其是固定宽度与自适应预滤波器宽度)如何影响GAN评估中的FID分数?
  • RQ2对真实训练图像或生成图像进行JPEG压缩在多大程度上改变FID分数,是否会导致人为的性能提升?
  • RQ3使用混叠缩放是否可能导致在比较检查点或方法时产生不同的模型选择结果?
  • RQ4当GAN未能建模低层次压缩伪影时,若真实图像和生成图像均被压缩,是否会导致FID分数出现误导性提升?
  • RQ5不一致的预处理(如压缩、缩放)对不同已发表GAN模型之间FID分数的可比性有何影响?

主要发现

  • 在PyTorch和TensorFlow中使用固定宽度预滤波的混叠缩放会在高下采样比例下引入明显的混叠伪影,污染特征提取并扭曲FID分数。
  • 采用随下采样因子自适应调整的预滤波器可减少FID分数差异,提升度量计算的可靠性。
  • 当真实训练图像被JPEG压缩时,若生成图像也经过压缩,FID分数可提升高达1.52分,即使模型未学习压缩伪影。
  • 在LSUN Church数据集(以JPEG-75格式收集)上,StyleGAN2模型在生成图像压缩质量为87时达到最佳FID为3.48,而PNG格式下为4.00,表明后处理带来了人为的度量提升。
  • 缩放方法显著影响模型选择:使用混叠缩放与抗混叠缩放可能导致选择不同的模型检查点作为“最佳”。
  • FID度量对低层次图像处理细节高度敏感,不一致的预处理会使跨模型比较失去有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。