Skip to main content
QUICK REVIEW

[论文解读] Hallucinating very low-resolution and obscured face images

Lianping Yang, Bin Shao|arXiv (Cornell University)|Nov 12, 2018
Advanced Image Processing Techniques参考文献 26被引用 4
一句话总结

该论文提出 OFHNet,一种新颖的深度学习框架,用于从极低分辨率(16×16 像素)且严重遮挡的输入中生成高分辨率(HR)人脸图像,放大倍数为 8×。该方法采用两阶段策略:首先,使用编码器-解码器图像修复网络恢复低分辨率图像中缺失的区域;随后,通过结合对抗性损失、语义结构损失(使用固定的人脸关键点)和 L2 损失的超分辨率上采样网络,实现最先进的感知质量与结构保真度,尤其在具有挑战性的遮挡输入下表现优异。

ABSTRACT

Most of the face hallucination methods are designed for complete inputs. They will not work well if the inputs are very tiny or contaminated by large occlusion. Inspired by this fact, we propose an obscured face hallucination network(OFHNet). The OFHNet consists of four parts: an inpainting network, an upsampling network, a discriminative network, and a fixed facial landmark detection network. The inpainting network restores the low-resolution(LR) obscured face images. The following upsampling network is to upsample the output of inpainting network. In order to ensure the generated high-resolution(HR) face images more photo-realistic, we utilize the discriminative network and the facial landmark detection network to better the result of upsampling network. In addition, we present a semantic structure loss, which makes the generated HR face images more pleasing. Extensive experiments show that our framework can restore the appealing HR face images from 1/4 missing area LR face images with a challenging scaling factor of 8x.

研究动机与目标

  • 解决从极低分辨率(16×16 像素)且严重遮挡的输入中生成高分辨率人脸图像(8× 放大倍数)的挑战。
  • 克服现有面部图像幻觉方法在输入不完整或过小情况下的局限性。
  • 通过引入人脸关键点先验作为语义正则化损失,提升生成的高分辨率人脸图像的感知质量和结构保真度。
  • 开发一种两阶段框架,先恢复低分辨率图像中的缺失区域,再进行超分辨率重建,从而降低重建难度。

提出的方法

  • 采用基于编码器-解码器的图像修复网络,恢复低分辨率、遮挡人脸图像中的缺失区域,确保已知区域与修复区域之间的语义一致性。
  • 一个独立的上采样网络对修复后的低分辨率图像执行 8× 超分辨率,结合 L2 损失、对抗性损失以及一种基于固定人脸关键点检测的新型语义结构损失。
  • 语义结构损失源自一个固定的预训练人脸关键点检测网络,为保持面部几何结构和提升视觉真实感提供监督。
  • 在上采样网络中应用对抗训练,通过区分生成的高分辨率图像与真实高分辨率图像,增强图像的逼真感。
  • 整个框架采用端到端训练,损失函数为多任务损失:L2 损失用于像素级重建,对抗性损失用于提升真实感,语义结构损失用于保持面部布局的保真度。
  • 整体架构为编码器-解码器-解码器框架:图像修复网络(第一解码器)、上采样网络(第二解码器),共享编码器用于特征提取。

实验结果

研究问题

  • RQ1深度学习框架能否有效从 16×16 像素输入(1/4 面积遮挡)和 8× 放大倍数下恢复高分辨率人脸图像?
  • RQ2将人脸关键点先验作为语义结构损失,能否显著提升生成人脸图像的感知质量和结构准确性?
  • RQ3两阶段方法(先图像修复,再超分辨率)是否优于直接对遮挡输入进行超分辨率?
  • RQ4L2 损失、对抗性损失与语义结构损失的组合,在生成逼真且结构准确的高分辨率人脸图像方面,是否显著优于标准损失函数?

主要发现

  • 在基准数据集上,OFHNet 实现了 20.44 dB 的 PSNR 和 0.63 的 SSIM,分别优于 URDGN 0.44 dB(PSNR)和 10.5%(SSIM)。
  • 引入语义结构损失后,视觉质量显著提升;定性对比显示,OFHNet 生成的面部特征比仅使用 L2 损失的基线模型更逼真、更精细。
  • 在人脸对齐与分割任务中,OFHNet 的 NRMSE(5.33)更低,IoU(0.60)更高,优于 URDGN(NRMSE:13.61,IoU:0.40),表明其几何保真度更优。
  • 该模型在随机遮挡模式(左上、右上、左下、右下)下泛化能力良好,始终能生成合理且连贯的高分辨率人脸重建结果。
  • 随着遮挡区域从 4×4 像素增加到 8×8 像素,PSNR 单调下降,证实了该方法在重建难度增加时仍具鲁棒性。
  • 消融研究证实,语义结构损失对视觉质量至关重要,其效果显著优于仅使用 L2 损失或仅使用对抗性损失的设置。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。