Skip to main content
QUICK REVIEW

[论文解读] A Large-Scale, Time-Synchronized Visible and Thermal Face Dataset

Domenick Poster, Matthew Thielke|arXiv (Cornell University)|Jan 7, 2021
Face recognition and analysis参考文献 39被引用 4
一句话总结

本文介绍了 ARL-VTF 数据集,这是目前公开可用的最大规模时间同步可见光与长波红外(LWIR)热成像人脸数据集,包含来自 395 名受试者的超过 50 万张图像。该数据集支持热成像人脸关键点检测与热成像到可见光的人脸验证的基准测试,采用基于 SAGAN 的合成方法实现 99.28% 的 AUC 得分,使用真实可见光探针时达到 99.63% 的 AUC 得分。

ABSTRACT

Thermal face imagery, which captures the naturally emitted heat from the face, is limited in availability compared to face imagery in the visible spectrum. To help address this scarcity of thermal face imagery for research and algorithm development, we present the DEVCOM Army Research Laboratory Visible-Thermal Face Dataset (ARL-VTF). With over 500,000 images from 395 subjects, the ARL-VTF dataset represents, to the best of our knowledge, the largest collection of paired visible and thermal face images to date. The data was captured using a modern long wave infrared (LWIR) camera mounted alongside a stereo setup of three visible spectrum cameras. Variability in expressions, pose, and eyewear has been systematically recorded. The dataset has been curated with extensive annotations, metadata, and standardized protocols for evaluation. Furthermore, this paper presents extensive benchmark results and analysis on thermal face landmark detection and thermal-to-visible face verification by evaluating state-of-the-art models on the ARL-VTF dataset.

研究动机与目标

  • 为解决研究中高质量、时间同步的可见光与热成像人脸图像稀缺的问题。
  • 支持在姿态变化、表情变化和遮挡等非约束条件下开发鲁棒的人脸识别模型。
  • 提供用于训练和评估热成像到可见光人脸验证及关键点检测模型的标准化协议。
  • 利用大规模、精心筛选的数据集,对最先进的深度学习模型在热成像人脸分析任务中的表现进行基准测试。

提出的方法

  • 使用双可见光相机系统与长波红外(LWIR)相机同步采集可见光与LWIR热成像图像。
  • 系统性地记录每位受试者的三组图像序列:基础姿态、表情变化和偏移姿态,另有一组用于眼镜佩戴条件。
  • 对所有图像进行头部姿态、眼镜佩戴、人脸边界框及 6 个面部关键点的标注。
  • 应用深度学习模型,包括 VGG-Face、Pix2Pix、GANVFS 和 SAGAN,用于跨模态人脸验证与图像生成。
  • 使用条件生成对抗网络(如 SAGAN)从热成像输入生成类似可见光的图像,以提升跨谱系匹配性能。
  • 采用标准化协议进行评估,指标包括 AUC、EER 和在不同条件下的关键点检测准确率。

实验结果

研究问题

  • RQ1在不同姿态和表情条件下,热成像到可见光的人脸验证性能如何变化?
  • RQ2眼镜遮挡在热成像域中在多大程度上会降低热成像到可见光的人脸验证准确率?
  • RQ3基于 GAN 的图像生成方法在提升跨谱系人脸验证性能方面效果如何?
  • RQ4姿态变化对热成像人脸关键点检测与验证准确率有何影响?
  • RQ5不同生成方法(如 Pix2Pix、SAGAN)在从热成像输入生成逼真可见光风格图像方面的表现如何比较?

主要发现

  • 基于 SAGAN 的图像生成方法在热成像到可见光人脸验证任务中实现了 99.28% 的 AUC,显著优于原始基线(61.37% AUC)。
  • 真实可见光探针基线在基础序列中达到 99.06% AUC,但在偏移姿态序列中性能下降至 75.76%,凸显姿态变化是主要挑战。
  • 表情变化导致性能下降,SAGAN 的 AUC 从 99.28% 降至 98.46%(在表情丰富的面部图像上)。
  • SAGAN 模型的等错误率(EER)为 3.97%,表明其具有高度鲁棒性;而 Pix2Pix 模型在姿态变化下的 EER 达到 33.8%。
  • 佩戴眼镜的热成像图像导致性能显著下降,原因在于镜片吸收热量,遮挡热信号,从而降低匹配准确率。
  • 该数据集的标准化协议与详尽的标注,使得在多样化真实世界条件下对热成像人脸分析模型进行可靠基准测试成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。