Skip to main content
QUICK REVIEW

[论文解读] Deep Semantic Face Deblurring

Ziyi Shen, Wei‐Sheng Lai|arXiv (Cornell University)|Mar 9, 2018
Advanced Image Processing Techniques参考文献 46被引用 11
一句话总结

本文提出了一种用于人脸去模糊的深度卷积神经网络,通过利用语义先验和局部结构约束来恢复高保真度的人脸细节。通过在端到端框架中整合全局人脸分割标签和多尺度损失,该方法在去模糊质量、人脸识别准确率和推理速度方面均达到最先进水平,在合成数据和真实世界模糊人脸上的表现均优于先前方法。

ABSTRACT

In this paper, we present an effective and efficient face deblurring algorithm by exploiting semantic cues via deep convolutional neural networks (CNNs). As face images are highly structured and share several key semantic components (e.g., eyes and mouths), the semantic information of a face provides a strong prior for restoration. As such, we propose to incorporate global semantic priors as input and impose local structure losses to regularize the output within a multi-scale deep CNN. We train the network with perceptual and adversarial losses to generate photo-realistic results and develop an incremental training strategy to handle random blur kernels in the wild. Quantitative and qualitative evaluations demonstrate that the proposed face deblurring algorithm restores sharp images with more facial details and performs favorably against state-of-the-art methods in terms of restoration quality, face recognition and execution speed.

研究动机与目标

  • 为解决单幅人脸去模糊的挑战,特别是当模糊核未知且人脸图像缺乏传统先验所需的强纹理时。
  • 通过利用人脸的高度结构化特性,结合眼睛、嘴巴和面部轮廓等语义线索,提升重建质量。
  • 降低计算成本,实现在移动设备和云平台等资源受限平台上的实时推理。
  • 通过在去模糊输出中保留身份保持特征,提升人脸识别性能。
  • 开发一种在真实世界场景中遇到的多样化、未知模糊核下具有良好泛化能力的训练策略。

提出的方法

  • 该方法采用多尺度深度CNN,以模糊人脸图像和预测的语义分割图作为输入,利用全局语义先验引导去模糊过程。
  • 在关键面部组件(眼睛、鼻子、嘴巴)上应用局部结构损失,以在训练过程中保留细微细节。
  • 使用感知损失和对抗性损失,通过匹配真实图像的特征和分布,生成逼真的输出。
  • 引入一种渐进式训练策略,即网络首先在小尺寸模糊核上进行训练,然后逐步在更大模糊核上微调,以提升泛化能力。
  • 通过预训练的人脸分割网络执行人脸分割,生成用于输入监督的语义标签。
  • 整个网络端到端训练,无需模糊核估计或后处理,从而实现快速推理。

实验结果

研究问题

  • RQ1与仅使用像素级损失的训练相比,从人脸分割中提取的语义先验是否能提升去模糊人脸图像的质量和保真度?
  • RQ2在面部组件上引入局部结构约束如何影响细微面部细节的恢复?
  • RQ3渐进式训练策略是否能有效应对真实世界数据中未知且多变的模糊核所导致的分布偏移?
  • RQ4在人脸识别准确率和推理速度方面,该方法在多大程度上优于最先进去模糊模型?
  • RQ5使用感知损失和对抗性损失是否能生成更自然、更逼真的去模糊人脸输出?

主要发现

  • 在真实世界模糊图像上,该方法的人脸检测成功率达到99%,显著优于先前方法(如Nah et al.的90%和Pan et al.的82%)。
  • 在CelebA数据集上,该方法的top-1人脸识别准确率达到54%,为所有对比方法中的最高值,表明其具有优越的身份保持能力。
  • 在GPU上,该方法对128×128图像的推理时间为0.05秒/张,快于所有其他评估方法,包括第二快的0.09秒/张。
  • 与无语义先验的基线相比,引入语义先验和局部结构损失使FaceNet嵌入的ID距离降低20%,表明身份一致性更优。
  • 在Lai et al.的真实世界模糊数据集上,视觉对比显示,该方法生成的面部细节更清晰,伪影更少,优于最先进方法。
  • 渐进式训练策略提升了收敛性和泛化能力,使模型能够处理广泛范围的模糊核尺寸,而无需完整的数据增强。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。