Skip to main content
QUICK REVIEW

[论文解读] Image Inpainting via Iteratively Decoupled Probabilistic Modeling

Wenbo Li, Xin Yu|arXiv (Cornell University)|Dec 6, 2022
Generative Adversarial Networks and Image Synthesis被引用 5
一句话总结

该论文提出了一种像素扩散模型(PSM),通过使用解耦的概率建模进行迭代优化,实现对大范围缺失区域的高质量、高效图像修复。该方法结合对抗性训练以实现快速、精确的均值预测,并通过显式高斯正则化生成不确定性图,从而实现对可靠像素的选择性优化——在推理速度提升10倍、参数量仅为20%的情况下,FID得分达到SOTA水平(相比LDM提升1.1分)。

ABSTRACT

Generative adversarial networks (GANs) have made great success in image inpainting yet still have difficulties tackling large missing regions. In contrast, iterative probabilistic algorithms, such as autoregressive and denoising diffusion models, have to be deployed with massive computing resources for decent effect. To achieve high-quality results with low computational cost, we present a novel pixel spread model (PSM) that iteratively employs decoupled probabilistic modeling, combining the optimization efficiency of GANs with the prediction tractability of probabilistic models. As a result, our model selectively spreads informative pixels throughout the image in a few iterations, largely enhancing the completion quality and efficiency. On multiple benchmarks, we achieve new state-of-the-art performance. Code is released at https://github.com/fenglinglwb/PSM.

研究动机与目标

  • 为解决大范围缺失区域的高质量、高效图像修复问题,其中GAN在训练中易出现不稳定,而扩散模型则计算成本过高。
  • 开发一种结合GAN优化效率与概率模型可塑性及不确定性估计优势的方法。
  • 在保持照片级真实感与多样性的同时,减少高质量生成所需的迭代步数。
  • 实现高分辨率图像(如512×512)的高效、可扩展推理,无需依赖大规模计算资源或大规模预训练。

提出的方法

  • 模型采用迭代解耦概率建模,每轮迭代并行预测均值(修复结果)与方差(不确定性图)。
  • 通过隐式对抗性训练优化均值项,实现更快收敛与更少迭代次数下的高保真生成。
  • 通过显式高斯正则化建模方差项,生成可靠的不确定性图,用于指导像素选择以进行后续优化。
  • 仅保留并传播不确定性较低的像素,实现‘像素扩散’机制,逐步以可信内容填充缺失区域。
  • 引入基于不确定性的注意力机制,增强长距离上下文建模,提升结构一致性与细节质量。
  • 采用统一的掩码调度策略,稳定不同迭代步长下的训练过程,提升泛化能力与性能表现。

实验结果

研究问题

  • RQ1结合对抗性训练与显式不确定性建模的混合方法,是否能在迭代次数上优于自回归或扩散模型,实现高质量图像修复?
  • RQ2显式不确定性估计相比标准GAN,在迭代图像补全中的可靠性与质量方面有何提升?
  • RQ3仅使用强扩散模型20%参数量的轻量化模型,能否在大孔洞图像修复任务中达到SOTA性能?
  • RQ4基于不确定性的注意力机制是否能增强高分辨率图像修复中的结构一致性与细节生成能力?

主要发现

  • 在Places2基准上,PSM相比强去噪扩散模型LDM实现1.1的FID分数提升,参数量减少20%,推理速度提升10倍。
  • 模型可在约250ms内生成512×512图像,显著优于LDM约3秒的推理时间。
  • 即使仅使用2000万张训练图像,PSM仍优于使用5000万张图像训练的模型(如CoModGAN),展现出优异的数据效率。
  • 不确定性图可有效筛选可靠预测结果,减少GAN伪影,提升视觉质量,定性对比结果已验证该优势。
  • 消融实验表明,统一掩码调度策略获得最优FID分数,表明其提升了各迭代步长间的训练稳定性。
  • 模型支持多样性生成,尤其在房间布局与建筑等复杂场景中,能生成更真实纹理与结构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。