Skip to main content
QUICK REVIEW

[论文解读] Cascaded Generation of High-quality Color Visible Face Images from Thermal Captures

Naser Damer, Fadi Boutros|arXiv (Cornell University)|Oct 21, 2019
Face recognition and analysis参考文献 21被引用 10
一句话总结

该论文提出了一种级联细化网络(CRN)与上下文损失相结合的方法,仅通过热成像捕获即可生成高质量的彩色可见光人脸图像,无需依赖大规模数据集、数据增强或偏振传感器。该方法在多种姿态、遮挡和光照条件下均实现了最先进的视觉质量与真实图像的定量相似性,其结果优于两种SOTA方法。

ABSTRACT

Generating visible-like face images from thermal images is essential to perform manual and automatic cross-spectrum face recognition. We successfully propose a solution based on cascaded refinement network that, unlike previous works, produces high quality generated color images without the need for face alignment, large databases, data augmentation, polarimetric sensors, computationally-intense training, or unrealistic restriction on the generated resolution. The training of our solution is based on the contextual loss, making it inherently scale (face area) and rotation invariant. We present generated image samples of unknown individuals under different poses and occlusion conditions.We also prove the high similarity in image quality between ground-truth images and generated ones by comparing seven quality metrics. We compare our results with two state-of-the-art approaches proving the superiority of our proposed approach.

研究动机与目标

  • 实现从热成像中生成高质量彩色可见光人脸图像,以支持跨谱面识别。
  • 克服先前方法依赖大规模数据集、数据增强、偏振传感器或计算量大的训练过程的局限性。
  • 在姿态变化、遮挡和低光照等挑战性条件下,生成视觉逼真且定量准确的可见光图像。
  • 在推理阶段无需人脸对齐,即可实现尺度和旋转不变性。
  • 在视觉质量与图像保真度度量方面,显著优于两种SOTA方法。

提出的方法

  • 该方法采用具有多尺度细化模块的级联细化网络(CRN),从低分辨率(4×4)开始,逐步上采样至目标分辨率(128×128)。
  • 每个细化模块由输入、中间和输出三层构成,实现高效多尺度特征学习,且参数量极少。
  • 训练过程通过上下文损失进行引导,强制模型在深层特征表示上保持相似性,使方法天然具备尺度和旋转不变性。
  • 该方法无需图像对齐、数据增强或偏振传感器,降低了对大规模或特殊数据集的依赖。
  • 模型在相对较小的数据集上进行端到端训练,利用上下文损失的不变性特性,实现鲁棒性能。

实验结果

研究问题

  • RQ1能否在不依赖大规模对齐训练数据集或数据增强的前提下,从热成像中生成高质量彩色可见光人脸图像?
  • RQ2在姿态和遮挡变化条件下,所提出的CRN结合上下文损失的方法与基于GAN的方法相比,在视觉质量和图像保真度方面表现如何?
  • RQ3与真实可见光图像相比,该方法在图像质量度量(如清晰度、对比度和亮度)方面保持程度如何?
  • RQ4该方法能否在无需显式对齐或监督的情况下,泛化至未见个体、姿态和遮挡条件?
  • RQ5上下文损失在生成图像中如何促进尺度和旋转不变性?

主要发现

  • 所提方法在多种姿态、面部表情和遮挡类型(包括眼镜、太阳镜、头饰和手部遮挡)下,均能从热成像输入生成视觉逼真的彩色可见光人脸图像。
  • 生成图像中仅存在极少数大尺度伪影,细微细节(如眼部区域)存在轻微不完美,尤其在非正脸姿态下更为明显。
  • 通过七项图像质量度量的定量分析证实,生成图像与真实图像高度相似,生成图像略显模糊且更亮,但对比度和GCF更高。
  • 上下文损失实现了尺度和旋转不变性,使模型无需推理阶段对齐即可实现良好泛化。
  • 该方法在视觉质量与度量相似性方面均优于两种SOTA基线方法(TV-GAN与PIX2PIX),LS值显著更低,表明生成图像具有更好的光照对称性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。