Skip to main content
QUICK REVIEW

[论文解读] Feature Refinement to Improve High Resolution Image Inpainting

Prakhar Kulshreshtha, Brian Pugh|arXiv (Cornell University)|Jun 27, 2022
Generative Adversarial Networks and Image Synthesis被引用 7
一句话总结

该论文提出了一种新颖的、无需训练的多尺度特征优化方法,通过在推理过程中使用多尺度一致性损失迭代优化中间特征图,以提升高分辨率图像修复的质量。通过在从低到高分辨率的预测中使用下采样输出的L1损失进行优化,该方法在不重新训练模型的情况下实现了1024×1024图像上的最先进性能,显著提升了结构连贯性和纹理细节。

ABSTRACT

In this paper, we address the problem of degradation in inpainting quality of neural networks operating at high resolutions. Inpainting networks are often unable to generate globally coherent structures at resolutions higher than their training set. This is partially attributed to the receptive field remaining static, despite an increase in image resolution. Although downscaling the image prior to inpainting produces coherent structure, it inherently lacks detail present at higher resolutions. To get the best of both worlds, we optimize the intermediate featuremaps of a network by minimizing a multiscale consistency loss at inference. This runtime optimization improves the inpainting results and establishes a new state-of-the-art for high resolution inpainting. Code is available at: https://github.com/geomagical/lama-with-refiner/tree/refinement.

研究动机与目标

  • 解决因有效感受野有限导致的高分辨率图像修复质量下降问题。
  • 在不重新训练基础网络的前提下,提升高分辨率修复的全局结构和纹理细节。
  • 通过利用低分辨率预测作为引导,实现更高分辨率修复结果的一致性和锐度提升。
  • 开发一种与现有最先进修复模型兼容的运行时优化技术。

提出的方法

  • 构建一个下采样因子为2的图像金字塔,从网络的训练分辨率(512px)开始,扩展至1024px。
  • 在最低分辨率进行一次前向传播,生成初始修复预测结果。
  • 对于每个更高分辨率,使用Adam优化器(初始学习率为0.002)对网络前端(编码器)的特征图进行15轮迭代优化。
  • 在掩码区域上最小化下采样后的高分辨率预测与低分辨率预测之间的L1损失。
  • 在损失计算前对掩码进行腐蚀处理(15px圆形核),以避免在细长或已较好完成的区域出现过拟合。
  • 使用高斯滤波后接双线性插值进行下采样,以防止混叠并确保跨尺度的平滑特征传递。

实验结果

研究问题

  • RQ1在推理过程中对特征图进行优化是否能在不重新训练的情况下提升高分辨率图像修复性能?
  • RQ2将低分辨率预测作为引导是否能增强高分辨率输出的结构连贯性和细节表现?
  • RQ3在1024×1024分辨率下,多尺度优化与最先进方法相比,在FID和LPIPS指标上的表现如何?
  • RQ4在应用迭代优化时,推理时间与性能增益之间的权衡关系如何?
  • RQ5一种与网络无关的运行时优化技术是否能在高分辨率图像修复基准上超越现有方法?

主要发现

  • 所提方法在1024×1024图像上实现了最先进水平的FID分数,中等画笔下为19.864,粗画笔下为26.401,优于Big-LaMa及其他SOTA方法。
  • LPIPS分数降低至0.115(中等)和0.135(粗),表明与真实图像的感知相似性显著提升。
  • 对于细画笔情况,性能与Big-LaMa相当(FID: 13.193),因为基础模型已具备足够的上下文信息以实现良好表现。
  • 该方法显著提升了纹理锐度和全局结构,尤其在大范围掩码的复杂区域表现突出。
  • 推理时间增加至每张图像4.56秒(对比Big-LaMa的0.26秒),原因在于跨多个尺度的多次前向/反向传播。
  • 由于反向传播期间需存储梯度,显存占用增加,限制了最大可在GPU上支持的分辨率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。