Skip to main content
QUICK REVIEW

[论文解读] VQFR: Blind Face Restoration with Vector-Quantized Dictionary and Parallel Decoder

Yuchao Gu, Xintao Wang|arXiv (Cornell University)|May 13, 2022
Face recognition and analysis被引用 7
一句话总结

VQFR 提出了一种使用向量量化(VQ)码本作为高质量面部细节词典的盲面部分辨率增强方法,并采用带有纹理扭曲模块的并行解码器以保持身份一致性和面部保真度。通过端到端学习全面的低级特征库,并在不污染生成细节的前提下融合输入特征,VQFR 在合成数据集和真实世界基准上均实现了面部细节真实感与保真度的最先进性能。

ABSTRACT

Although generative facial prior and geometric prior have recently demonstrated high-quality results for blind face restoration, producing fine-grained facial details faithful to inputs remains a challenging problem. Motivated by the classical dictionary-based methods and the recent vector quantization (VQ) technique, we propose a VQ-based face restoration method - VQFR. VQFR takes advantage of high-quality low-level feature banks extracted from high-quality faces and can thus help recover realistic facial details. However, the simple application of the VQ codebook cannot achieve good results with faithful details and identity preservation. Therefore, we further introduce two special network designs. 1). We first investigate the compression patch size in the VQ codebook and find that the VQ codebook designed with a proper compression patch size is crucial to balance the quality and fidelity. 2). To further fuse low-level features from inputs while not "contaminating" the realistic details generated from the VQ codebook, we proposed a parallel decoder consisting of a texture decoder and a main decoder. Those two decoders then interact with a texture warping module with deformable convolution. Equipped with the VQ codebook as a facial detail dictionary and the parallel decoder design, the proposed VQFR can largely enhance the restored quality of facial details while keeping the fidelity to previous methods.

研究动机与目标

  • 为解决在未知退化条件下盲面部分辨率增强中恢复细粒度面部细节的挑战。
  • 克服现有方法在保留身份特征和生成逼真纹理(尤其是发丝和细微面部结构)方面的局限。
  • 开发一种基于 VQ 的面部细节词典,捕捉所有面部区域的全面低级特征,而不仅限于孤立组件。
  • 设计一种带有纹理扭曲模块的并行解码器,实现输入特征与 VQ 生成纹理的融合,同时不降低真实感或保真度。
  • 在真实世界复杂退化场景下,实现感知质量与身份保留之间的平衡。

提出的方法

  • VQ 码本通过端到端训练,从高分辨率人脸中学习高质量的面部细节词典,采用 f=32 的压缩块大小以实现质量与保真度之间的最佳权衡。
  • 提出一种并行解码器架构,由主解码器和纹理解码器组成,分别处理输入特征和 VQ 生成的特征,随后进行融合。
  • 纹理扭曲模块使用可变形卷积,动态对齐来自 VQ 码本的高频细节与退化输入的空间结构。
  • 在解码器的多个阶段,将退化图像的输入特征与 VQ 生成的特征进行融合,以保持身份和表情的准确性。
  • 通过感知损失、对抗性损失和重建损失的组合进行训练,以增强真实感和细节保真度。
  • VQ 码本被优化为在离散潜在空间中表示面部块,从而实现高效且鲁棒的特征检索,用于细节恢复。

实验结果

研究问题

  • RQ1端到端训练的向量量化码本能否作为有效的面部细节词典,其恢复真实感是否超越仅针对特定组件设计的词典?
  • RQ2VQ 码本中压缩块大小的选择如何影响视觉质量与身份保真度之间的权衡?
  • RQ3并行解码器架构能否在不降低细节质量的前提下,有效结合低级输入特征与高质量 VQ 生成特征?
  • RQ4带有可变形卷积的纹理扭曲模块是否能改善恢复细节与输入几何结构之间的对齐,尤其是在严重退化条件下?
  • RQ5VQFR 在具有复杂未知退化的现实世界数据集上,其泛化能力如何,同时保持高感知质量与身份保留?

主要发现

  • 在 CelebA-Test 上,VQFR 的 FID 达到 41.28,其感知质量与身份保真度均优于 GFP-GAN 和 DFDNet。
  • 地标距离降低至 2.43,表明面部表情与结构的保留能力极强,与 GFP-GAN 相当。
  • 通过采用并行解码器与纹理扭曲模块,VQFR 的 NIQE 降低至 3.693,表明其在高频细节恢复方面优于基线变体。
  • 在真实世界数据集(LFW-Test、CelebChild-Test、WebPhoto-Test)上,VQFR 显著提升了感知质量与真实感,在保真度方面优于 PULSE 和 GFP-GAN。
  • 消融实验表明,输入特征与并行解码器至关重要:若移除它们,地标距离将增加 10%,且精细细节丢失。
  • 当 f=32 时,VQ 码本在真实感与保真度之间达到最佳平衡;更大的块尺寸虽提升视觉质量,但会损害身份保留。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。