[论文解读] FaceFormer: Scale-aware Blind Face Restoration with Transformers
FaceFormer 提出了一种基于新型面部特征上采样(FFUP)模块和分层 Transformer 架构的面部特征嵌入(FFE)模块的尺度感知盲面部修复框架,实现了在任意输入尺度下的高保真、逼真且对称的面部修复。该方法在合成数据上进行训练,相比最先进方法,对真实世界低质量图像的泛化能力更强。
Blind face restoration usually encounters with diverse scale face inputs, especially in the real world. However, most of the current works support specific scale faces, which limits its application ability in real-world scenarios. In this work, we propose a novel scale-aware blind face restoration framework, named FaceFormer, which formulates facial feature restoration as scale-aware transformation. The proposed Facial Feature Up-sampling (FFUP) module dynamically generates upsampling filters based on the original scale-factor priors, which facilitate our network to adapt to arbitrary face scales. Moreover, we further propose the facial feature embedding (FFE) module which leverages transformer to hierarchically extract diversity and robustness of facial latent. Thus, our FaceFormer achieves fidelity and robustness restored faces, which possess realistic and symmetrical details of facial components. Extensive experiments demonstrate that our proposed method trained with synthetic dataset generalizes better to a natural low quality images than current state-of-the-arts.
研究动机与目标
- 为解决现有面部修复方法受限于特定输入尺度的问题,尤其是在具有任意退化特性的现实场景中。
- 通过利用尺度感知特征学习和分层注意力机制,提升修复的保真度和鲁棒性。
- 在不依赖真实退化先验的情况下,实现从合成训练数据到真实世界低质量面部图像的泛化能力。
- 在极端放大和严重退化条件下,保持身份一致性以及瞳孔、眉毛和睫毛等真实面部细节。
提出的方法
- 面部特征上采样(FFUP)模块基于输入的尺度因子先验,动态生成尺度感知的上采样滤波器,实现无需固定分辨率约束的任意尺度面部修复。
- 面部特征嵌入(FFE)模块采用具有非重叠局部窗口和跨窗口连接的分层 Transformer 架构,以提取多样化且鲁棒的面部潜在特征。
- 该框架将 FFUP 和 FFE 整合到统一的面部修复流程中,结合了尺度感知特征优化与基于注意力的特征增强。
- 该方法利用超分辨率主干网络配合分数阶采样器,在将特征输入 FFE 和生成器模块前,对尺度感知特征进行细化。
- FFE 模块通过分层方式在多头自注意力机制中建模长距离依赖关系和局部面部组件结构,以增强特征表示。
- 整个框架在合成数据集上端到端训练,并在无需微调的情况下有效泛化到真实世界低质量图像。
实验结果
研究问题
- RQ1盲面部分辨模型是否能在不依赖固定分辨率输入的前提下,有效泛化到任意输入尺度?
- RQ2尺度感知上采样机制在极端放大场景中如何提升修复质量并减少伪影?
- RQ3分层 Transformer 架构的特征嵌入模块在多大程度上提升了修复面部组件的保真度和逼真度?
- RQ4尽管在合成数据上进行训练,该框架是否在真实世界低质量面部图像上仍优于最先进方法?
主要发现
- FaceFormer 在真实世界数据集 LFW-test 和 CelebChild 上达到最先进性能,CelebA-Test 上 FID 为 13.17,LPIPS 为 0.3237,优于先前方法。
- 消融实验表明,移除 FFUP 模块后,LPIPS 增加 0.0265,FID 增加 4.65,表明感知质量与身份保持能力显著下降。
- 若不使用 FFE 模块,FID 暴增至 42.62,LPIPS 上升至 0.3646,表明其在维持面部结构与细节保真度方面具有关键作用。
- 在极端放大倍数(×6.0 和 ×8.0)下,FaceFormer 的结果在感知质量上优于 GFP-GAN,眉毛更清晰,皮肤纹理更逼真。
- 定性结果第4行显示,该方法成功保持了瞳孔颜色的一致性,表明具备强大的身份一致性。
- 视觉对比显示,FaceFormer 避免了 HiFaceGAN 和 Wan 等方法常见的透明伪影与模糊现象,尤其在眼睛和嘴部区域表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。