[论文解读] Deep Face Super-Resolution with Iterative Collaboration between Attentive Recovery and Landmark Estimation
本文提出了一种用于人脸超分的深度迭代协作网络,通过两个循环分支交替优化高分辨率人脸图像与面部关键点估计。通过使用注意力融合模块引导特定组件的特征提取,该方法在CelebA和Helen数据集上实现了最先进性能,PSNR提升至27.37,SSIM提升至0.7962。
Recent works based on deep learning and facial priors have succeeded in super-resolving severely degraded facial images. However, the prior knowledge is not fully exploited in existing methods, since facial priors such as landmark and component maps are always estimated by low-resolution or coarsely super-resolved images, which may be inaccurate and thus affect the recovery performance. In this paper, we propose a deep face super-resolution (FSR) method with iterative collaboration between two recurrent networks which focus on facial image recovery and landmark estimation respectively. In each recurrent step, the recovery branch utilizes the prior knowledge of landmarks to yield higher-quality images which facilitate more accurate landmark estimation in turn. Therefore, the iterative information interaction between two processes boosts the performance of each other progressively. Moreover, a new attentive fusion module is designed to strengthen the guidance of landmark maps, where facial components are generated individually and aggregated attentively for better restoration. Quantitative and qualitative experimental results show the proposed method significantly outperforms state-of-the-art FSR methods in recovering high-quality face images.
研究动机与目标
- 解决现有面部超分方法中不准确的面部先验问题,这些先验通常源自低质量或粗糙的输入。
- 克服多任务学习框架中仅将关键点图与特征拼接所导致的间接且微弱的先验知识引导。
- 通过图像恢复与关键点估计之间的双向、迭代优化,提升超分人脸图像的质量。
- 设计一种组件特定的注意力机制,以更好地利用面部结构,增强高分辨率输出中的细节恢复。
提出的方法
- 提出一种具有两个分支的循环架构:一个用于图像恢复,另一个用于面部关键点估计,实现迭代协作。
- 采用循环沙漏网络进行关键点估计,基于逐步更精确的图像输入,逐步优化关键点位置。
- 引入一种新颖的注意力融合模块,利用估计的关键点生成针对每个面部组件(眼睛、鼻子、嘴巴)的独立注意力图。
- 应用组卷积并结合组件特定的注意力图,提取并聚合针对各个面部部位量身定制的特征。
- 通过学习到的注意力权重融合组件特定特征,以指导恢复分支中的高保真图像重建。
- 实施反馈回路,使每次迭代均以前一次两个分支的输出作为下一轮的输入,实现渐进式优化。
实验结果
研究问题
- RQ1图像恢复与关键点估计之间的迭代协作是否能提升超分人脸图像的质量?
- RQ2是否使用准确、高质量的关键点估计作为先验知识,能比使用低分辨率或粗糙先验带来更好的图像恢复效果?
- RQ3一种对各面部组件分别处理的注意力融合机制,是否能优于简单拼接关键点图的引导方式?
- RQ4在PSNR、SSIM和视觉保真度方面,该方法与当前最先进的人脸超分方法相比表现如何?
主要发现
- 在CelebA数据集上,所提方法达到27.37的PSNR和0.7962的SSIM,显著优于基线模型DIC-NL(26.31 PSNR)和DIC-CL(26.93 PSNR)。
- 视觉结果表明,随着迭代进行,图像质量和关键点准确性均逐步提升,超分输出变得更加逼真且几何上合理。
- 消融实验表明,若移除关键点引导(DIC-NL),性能严重下降;而仅通过拼接关键点(DIC-CL)仅带来部分改善,证明了所提注意力融合机制的优越性。
- 注意力融合模块实现了组件专业化特征提取,可视化结果表明:当选择性地应用注意力图时,各面部部件(眼睛、鼻子、嘴巴)能以高保真度被恢复。
- 该框架在多个迭代中均表现出一致的性能提升,表3和图5表明,三次迭代在质量与计算成本之间提供了良好的平衡。
- 该方法在两个基准数据集——CelebA和Helen上均表现出鲁棒性与有效性,证实了其在多样化人脸图像上的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。