Skip to main content
QUICK REVIEW

[论文解读] Face2PPG: An unsupervised pipeline for blood volume pulse extraction from faces

Constantino Álvarez Casado, Miguel Bordallo López|arXiv (Cornell University)|Feb 8, 2022
Non-Invasive Vital Sign Monitoring被引用 9
一句话总结

该论文提出 Face2PPG,一种无监督的 rPPG 流水线,通过三种新颖组件提升从面部视频中提取容积脉搏波的能力:基于刚性网格的面部稳定化、基于统计与分形分析的动态区域选择,以及基于 QR 分解的 RGB 到 PPG 转换(OMIT)。该方法在无监督、非学习型 rPPG 方法中达到最先进性能,在基准数据集上的平均绝对误差(MAE)低至 2.8 ± 3.0 bpm,媲美部分有监督深度学习方法,同时保持较低计算成本(每帧 17 ms)。

ABSTRACT

Photoplethysmography (PPG) signals have become a key technology in many fields, such as medicine, well-being, or sports. Our work proposes a set of pipelines to extract remote PPG signals (rPPG) from the face robustly, reliably, and configurable. We identify and evaluate the possible choices in the critical steps of unsupervised rPPG methodologies. We assess a state-of-the-art processing pipeline in six different datasets, incorporating important corrections in the methodology that ensure reproducible and fair comparisons. In addition, we extend the pipeline by proposing three novel ideas; 1) a new method to stabilize the detected face based on a rigid mesh normalization; 2) a new method to dynamically select the different regions in the face that provide the best raw signals, and 3) a new RGB to rPPG transformation method, called Orthogonal Matrix Image Transformation (OMIT) based on QR decomposition, that increases robustness against compression artifacts. We show that all three changes introduce noticeable improvements in retrieving rPPG signals from faces, obtaining state-of-the-art results compared with unsupervised, non-learning-based methodologies and, in some databases, very close to supervised, learning-based methods. We perform a comparative study to quantify the contribution of each proposed idea. In addition, we depict a series of observations that could help in future implementations.

研究动机与目标

  • 为解决无监督 rPPG 方法比较评估中因流水线配置和信号处理选择不一致而导致的可重复性与公平性不足问题。
  • 在真实场景条件下(如头部运动、面部表情变化和光照变化)提升 rPPG 信号提取的鲁棒性与可靠性。
  • 开发一种完全无监督、非学习型的流水线,实现与有监督深度学习方法相当的性能,且无需训练数据。
  • 引入新颖组件,以增强 rPPG 提取过程中信号的稳定性、噪声抑制能力及对伪影的鲁棒性。

提出的方法

  • 提出一种基于面部关键点的刚性网格归一化技术,实现对一致面部区域的信号提取,无论姿态或表情如何变化。
  • 采用统计与分形分析,动态识别并选择信噪比最高的面部区域,排除噪声大或易受伪影影响的区域。
  • 提出正交矩阵图像变换(OMIT),一种基于 QR 分解的新型 RGB 到 PPG 转换方法,增强对视频压缩伪影的鲁棒性。
  • 通过确保一致的面部检测、跟踪、滤波与谱分析,标准化六大数据集上的评估流水线,实现公平且可重复的比较。
  • 应用多阶段信号处理流水线:面部检测 → 网格归一化 → 皮肤分割 → 动态 ROI 选择 → 原始信号提取 → 滤波 → 谱分析。
  • 使用谱分析(如频域峰值检测)从最终 rPPG 信号中估计心率,并通过后处理优化估计结果。

实验结果

研究问题

  • RQ1如何缓解面部运动与面部表情变化的影响,以确保在时间序列中对同一面部区域的 rPPG 信号提取保持一致?
  • RQ2可采用何种标准自动识别并选择实时 rPPG 信号提取中最可靠的面部区域?
  • RQ3如何使 RGB 到 PPG 的转换步骤在不依赖深度学习的前提下,对视频压缩伪影更具鲁棒性?
  • RQ4与现有无监督、非学习型方法相比,所提出组件在多样化真实世界数据集上的 rPPG 性能提升程度如何?
  • RQ5完全无监督的流水线是否能在无需训练数据的情况下,实现与有监督深度学习方法相当的 rPPG 提取性能?

主要发现

  • 所提出的刚性网格归一化显著提升了信号一致性,确保在不同姿态和运动下对同一面部区域进行稳定跟踪。
  • 基于统计与分形分析的动态区域选择有效降低了噪声与伪影,提升了原始信号提取的可靠性。
  • 基于 QR 分解的 OMIT 转换方法在抗视频压缩伪影方面优于传统基于颜色的方法,表现出更优的鲁棒性。
  • Face2PPG 在 UBFC-Motion 数据集上实现 2.8 ± 3.0 bpm 的平均绝对误差(MAE),优于所有先前的无监督非学习型 rPPG 方法。
  • 该方法在无监督 rPPG 流水线中达到最先进水平,其 MAE 值分别为:MAHNOB 数据集 5.5 ± 5.0 bpm,UBFC-PPG 数据集 9.8 ± 4.6 bpm,PURE 数据集 12.5 ± 5.8 bpm,接近部分有监督深度学习模型的性能。
  • 该流水线每帧处理耗时 17 ms(含面部检测时低于 33 ms),相较于基于深度学习的 rPPG 方法具有显著的计算优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。