[论文解读] Contrast-Phys: Unsupervised Video-based Remote Physiological Measurement via Spatiotemporal Contrast
该论文提出 Contrast-Phys,一种基于视频的无监督远程光电容积脉搏波(rPPG)方法,通过利用时空对比学习从人脸视频中估计心率等生理信号,而无需依赖真实标签。通过挖掘同一视频内不同空间和时间位置的rPPG信号相似性,以及不同视频间rPPG信号的差异性,该方法在性能上与最先进的监督型rPPG模型相当,同时显著提升了速度并增强了对噪声的鲁棒性。
Video-based remote physiological measurement utilizes face videos to measure the blood volume change signal, which is also called remote photoplethysmography (rPPG). Supervised methods for rPPG measurements achieve state-of-the-art performance. However, supervised rPPG methods require face videos and ground truth physiological signals for model training. In this paper, we propose an unsupervised rPPG measurement method that does not require ground truth signals for training. We use a 3DCNN model to generate multiple rPPG signals from each video in different spatiotemporal locations and train the model with a contrastive loss where rPPG signals from the same video are pulled together while those from different videos are pushed away. We test on five public datasets, including RGB videos and NIR videos. The results show that our method outperforms the previous unsupervised baseline and achieves accuracies very close to the current best supervised rPPG methods on all five datasets. Furthermore, we also demonstrate that our approach can run at a much faster speed and is more robust to noises than the previous unsupervised baseline. Our code is available at https://github.com/zhaodongsun/contrast-phys.
研究动机与目标
- 开发一种无监督rPPG方法,以消除训练过程中对昂贵真实生理信号标签的需求。
- 提升对周期性噪声和头部运动的鲁棒性,这些因素通常会降低现有无监督rPPG方法的性能。
- 仅使用视频数据且不依赖任何标记的生理信号,实现与监督型rPPG模型相当的性能。
- 通过避免先前自监督方法中冗余的模型前向传播,提升训练效率。
提出的方法
- 该方法引入一种时空rPPG(ST-rPPG)块表示,从单个视频中提取多个在空间(高度、宽度)和时间(时间)维度上的rPPG信号。
- 采用3D卷积神经网络(3D CNN)主干网络处理视频片段,生成ST-rPPG特征,实现对rPPG信号的联合空间与时间建模。
- 应用对比学习,通过对比损失将来自同一视频的rPPG信号(正样本对)拉近,同时将来自不同视频的rPPG信号(负样本对)推开。
- 该方法基于四个关键rPPG观察:面部区域间rPPG信号的空间相似性、短片段内rPPG信号的时间相似性、不同视频间rPPG信号的差异性,以及心率范围的有界性(0.66–4.16 Hz)。
- 采用时空采样从同一视频的不同空间和时间位置生成正样本对,而负样本对则来自不同视频。
- 通过对比损失端到端优化训练目标,无需真实标签。
实验结果
研究问题
- RQ1能否在不依赖任何真实生理标签的情况下,从人脸视频中准确估计rPPG信号?
- RQ2时空对比学习是否能有效利用rPPG中的内在信号规律,以实现无监督表示学习?
- RQ3与现有无监督rPPG基线相比,该方法在准确性、速度和噪声鲁棒性方面表现如何?
- RQ4ST-rPPG块构建的最优时空分辨率和片段长度是什么?
主要发现
- Contrast-Phys 在全部五个公开数据集上均优于先前的无监督基线方法 [Gideon2021],在 UBFC-rPPG 数据集上实现平均绝对误差(MAE)0.64 bpm,而先前方法为 1.85 bpm。
- 在 UBFC-rPPG 数据集上,Contrast-Phys 实现 R 值 0.995,与最佳监督型rPPG方法极为接近。
- 当注入周期性噪声时,Contrast-Phys 保持 MAE 0.74 bpm 和 R 值 0.991,而 Gideon2021 性能显著下降至 MAE 22.47 bpm 和 R 值 0.244。
- 由于避免了冗余的前向传播,该方法相比先前的无监督方法运行速度显著更快。
- 消融实验表明,2×2 的空间分辨率和 10 秒的时序长度可实现最优性能,兼顾感受野大小与信号质量。
- 显著性图分析表明,Contrast-Phys 正确聚焦于面部皮肤区域,即使在噪声或头部运动干扰下仍保持稳定,而 Gideon2021 展现出不稳定且对噪声敏感的注意力模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。