[论文解读] Contrast-Phys+: Unsupervised and Weakly-supervised Video-based Remote Physiological Measurement via Spatiotemporal Contrast
Contrast-Phys+ 是一种新颖的无监督和弱监督视频远程光体积脉搏波图(rPPG)方法,利用时空对比学习并结合 rPPG 特定先验——空间相似性、时间一致性、跨视频差异性以及心率范围约束。即使在无真实标签或标签错位/缺失的情况下,该方法仍能实现最先进性能,在准确性、抗噪性及计算效率方面优于监督 SOTA 方法。
Video-based remote physiological measurement utilizes facial videos to measure the blood volume change signal, which is also called remote photoplethysmography (rPPG). Supervised methods for rPPG measurements have been shown to achieve good performance. However, the drawback of these methods is that they require facial videos with ground truth (GT) physiological signals, which are often costly and difficult to obtain. In this paper, we propose Contrast-Phys+, a method that can be trained in both unsupervised and weakly-supervised settings. We employ a 3DCNN model to generate multiple spatiotemporal rPPG signals and incorporate prior knowledge of rPPG into a contrastive loss function. We further incorporate the GT signals into contrastive learning to adapt to partial or misaligned labels. The contrastive loss encourages rPPG/GT signals from the same video to be grouped together, while pushing those from different videos apart. We evaluate our methods on five publicly available datasets that include both RGB and Near-infrared videos. Contrast-Phys+ outperforms the state-of-the-art supervised methods, even when using partially available or misaligned GT signals, or no labels at all. Additionally, we highlight the advantages of our methods in terms of computational efficiency, noise robustness, and generalization. Our code is available at https://github.com/zhaodongsun/contrast-phys.
研究动机与目标
- 解决监督 rPPG 训练中获取真实生理信号的高成本与高难度问题。
- 开发一个统一框架,使其在无监督、弱监督和半监督设置下均能有效运行。
- 在无需完全标注数据的前提下,提升对噪声、头部运动和标签错位的鲁棒性。
- 在真实 rPPG 应用中提升泛化能力与计算效率。
提出的方法
- 使用 3D 卷积神经网络从面部视频片段中提取多个时空 rPPG 信号。
- 设计一种对比损失函数,将同一视频中的 rPPG 信号聚类,同时将不同视频中的信号相互推开。
- 在对比目标中融入 rPPG 先验:空间相似性、时间一致性、跨视频差异性以及心率范围(40–250 bpm)。
- 通过将部分或错位的真实标签信号整合进对比学习过程,实现对弱监督的适应。
- 采用基于梯度的显著性图来解释模型注意力机制,验证其对面部皮肤区域的关注。
- 通过数据增强进行端到端训练,利用对比学习实现自监督与标签高效性。

实验结果
研究问题
- RQ1仅依赖视频数据和 rPPG 先验,能否在无任何真实生理信号的情况下准确估计 rPPG?
- RQ2当使用部分标注或错位的真实标签进行训练时,该模型相较于完全监督基线的表现如何?
- RQ3融入 rPPG 特定先验在多大程度上提升了对噪声和运动伪影的鲁棒性?
- RQ4该模型在无需微调的情况下,能否良好泛化到未见的数据集和视频条件?
- RQ5对比学习目标在多大程度上提升了信号质量与模型可解释性?
主要发现
- 在 UBFC-rPPG 数据集上,Contrast-Phys+ 在无注入噪声条件下实现平均绝对误差(MAE)0.64 bpm,优于 Gideon2021(1.85 bpm)的性能。
- 在视频中注入周期性噪声后,Contrast-Phys+ 的 MAE 保持在 0.74 bpm,而 Gideon2021 下降至 22.47 bpm,展现出更优的抗噪能力。
- 即使在 0% 标注数据下,Contrast-Phys+ 与真实信号的皮尔逊相关系数仍达 0.991,某些场景下超越了完全监督方法。
- 随着标签比例的提升,模型的 rPPG 波形与真实信号的对齐程度不断提高,100% 标签时实现近乎完美的峰值检测。
- 显著性图证实,Contrast-Phys+ 始终聚焦于面部皮肤区域,而基线方法如 Gideon2021 则易受噪声或运动伪影干扰。
- 该方法在五个公开数据集上均表现出良好泛化能力,涵盖 RGB 和近红外视频,展现出强大的跨数据集鲁棒性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。