Skip to main content
QUICK REVIEW

[论文解读] DifFace: Blind Face Restoration with Diffused Error Contraction

Zongsheng Yue, Chen Change Loy|arXiv (Cornell University)|Dec 13, 2022
Facial Nerve Paralysis Treatment and Research被引用 14
一句话总结

DifFace 提出了一种新颖的无监督人脸复原方法,利用预训练的扩散模型从低质量输入中推断出高质量的人脸图像,而无需复杂的损失函数。通过建模从低质量图像到中间扩散状态的过渡分布,并利用扩散模型的反向过程进行优化,DifFace 仅使用 L1 损失监督,就在未见过的复杂退化情况下表现出强大的鲁棒性,其在人脸复原和图像修复任务中的表现优于当前最先进方法。

ABSTRACT

While deep learning-based methods for blind face restoration have achieved unprecedented success, they still suffer from two major limitations. First, most of them deteriorate when facing complex degradations out of their training data. Second, these methods require multiple constraints, e.g., fidelity, perceptual, and adversarial losses, which require laborious hyper-parameter tuning to stabilize and balance their influences. In this work, we propose a novel method named DifFace that is capable of coping with unseen and complex degradations more gracefully without complicated loss designs. The key of our method is to establish a posterior distribution from the observed low-quality (LQ) image to its high-quality (HQ) counterpart. In particular, we design a transition distribution from the LQ image to the intermediate state of a pre-trained diffusion model and then gradually transmit from this intermediate state to the HQ target by recursively applying a pre-trained diffusion model. The transition distribution only relies on a restoration backbone that is trained with $L_2$ loss on some synthetic data, which favorably avoids the cumbersome training process in existing methods. Moreover, the transition distribution can contract the error of the restoration backbone and thus makes our method more robust to unknown degradations. Comprehensive experiments show that DifFace is superior to current state-of-the-art methods, especially in cases with severe degradations. Code and model are available at https://github.com/zsyOAOA/DifFace.

研究动机与目标

  • 为了解决现有无监督人脸复原方法在面对未见过或复杂退化时表现受限的问题,这些方法依赖于不匹配的退化模型。
  • 消除对复杂、手工设计的损失函数(如对抗性、感知损失)的需求,这些损失函数需要大量超参数调优。
  • 开发一种训练高效的复原方法,利用预训练扩散模型的先验知识,无需微调或重新训练。
  • 通过采用扩散中间表示来压缩误差,提升对严重退化情况的鲁棒性。
  • 在统一、基于原理的后验推断框架下,实现人脸复原和人脸图像修复任务的优异性能。

提出的方法

  • DifFace 通过引入一个过渡分布 p(xₙ|y₀),其中 xₙ 是中间扩散状态,来建模给定低质量输入 y₀ 时高质量人脸图像 x₀ 的后验分布 p(x₀|y₀)。
  • 该过渡分布通过仅在合成数据上使用 L1 损失进行训练的复原主干网络学习,从而实现高效且稳定的训练。
  • 该方法利用预训练扩散模型的反向马尔可夫链,从 xₙ 生成 x₀,从而在不重新训练的情况下利用丰富的图像先验知识。
  • 通过应用缩放因子小于 1 的类似扩散的过程,过渡过程压缩了低质量输入与高质量目标之间的残差误差。
  • 在采样过程中引入一个带有超参数 γ 的优化策略,以细化结果并提升图像修复中遮挡区域与未遮挡区域之间的连贯性。
  • 通过使用 DDIM 采样方法加速推理,将推理步数减少至 20 步,性能损失极小,推理速度与 CodeFormer 相当。

实验结果

研究问题

  • RQ1基于扩散的方法是否能在不依赖复杂损失函数或重新训练扩散模型的前提下,实现鲁棒的无监督人脸复原?
  • RQ2该过渡分布在压缩误差和提升对未见退化情况的鲁棒性方面效果如何?
  • RQ3该方法在训练期间未见过的真实世界复杂退化情况下是否具有良好的泛化能力?
  • RQ4带有超参数 γ 的优化策略如何影响人脸图像修复中生成结果的连贯性?
  • RQ5在不牺牲复原质量的前提下,推理速度能提升到何种程度?

主要发现

  • DifFace 在无监督人脸复原和人脸图像修复任务中均优于当前最先进方法,尤其在严重退化和大范围遮挡情况下表现更优。
  • 在 CelebA-Test 数据集上,DifFace 实现了具有竞争力的推理速度——20 步 DDIM 推理仅需 0.92 秒,速度介于 DFDNet 和 CodeFormer 之间,且性能与 CodeFormer 相当。
  • 该方法在复杂退化情况下表现出卓越的鲁棒性,即使 GAN 基方法失效,仍能保持高感知质量和结构连贯性。
  • 仅使用单一 L1 损失训练复原主干网络,显著简化了训练流程,相比多损失方法更为简洁。
  • 带有 γ 的优化策略能有效减少遮挡区域与未遮挡区域之间的不连贯性,尤其当 γ > 0 时效果更明显。
  • 即使退化模型不匹配,该方法仍能保持强大性能,展现出对真实世界数据的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。