[论文解读] Overcoming Difficulty in Obtaining Dark-skinned Subjects for Remote-PPG by Synthetic Augmentation
本文提出一种合成数据增强方法,通过将浅肤色人脸视频翻译为深肤色,同时保留脉动性生理信号,以解决远程光体积脉搏波图(rPPG)数据集中深肤色受试者不足的问题。联合优化框架使深肤色受试者的平均绝对误差降低31%,与仅使用真实数据训练相比,偏差缓解程度提高46%。
Camera-based remote photoplethysmography (rPPG) provides a non-contact way to measure physiological signals (e.g., heart rate) using facial videos. Recent deep learning architectures have improved the accuracy of such physiological measurement significantly, yet they are restricted by the diversity of the annotated videos. The existing datasets MMSE-HR, AFRL, and UBFC-RPPG contain roughly 10%, 0%, and 5% of dark-skinned subjects respectively. The unbalanced training sets result in a poor generalization capability to unseen subjects and lead to unwanted bias toward different demographic groups. In Western academia, it is regrettably difficult in a university setting to collect data on these dark-skinned subjects. Here we show a first attempt to overcome the lack of dark-skinned subjects by synthetic augmentation. A joint optimization framework is utilized to translate real videos from light-skinned subjects to dark skin tones while retaining their pulsatile signals. In the experiment, our method exhibits around 31% reduction in mean absolute error for the dark-skinned group and 46% improvement on bias mitigation for all the groups, as compared with the previous work trained with just real samples.
研究动机与目标
- 解决rPPG数据集中深肤色受试者代表性不足的问题,该问题限制了模型的泛化能力并引入了人口统计偏差。
- 克服在大学研究环境中收集深肤色个体真实世界数据的实际挑战。
- 开发一种方法,生成具有深肤色外观的逼真人脸视频,同时保留准确的生理脉动信号,用于训练rPPG模型。
- 提升rPPG模型在多样化人口群体中的公平性和性能,特别是对代表性不足的人群。
提出的方法
- 使用联合优化框架,将来自浅肤色受试者的实际人脸视频翻译为深肤色,同时保留脉动性血容量脉搏(BVP)信号。
- 采用基于物理的光照模型对皮肤反射率进行建模,分离静态与动态分量,包括脉动信号p(t)。
- 将视频强度表述为C_k(t) = I_0(1 + i(t)) · (u_c·c_0 + u_s·s(t) + u_p·p(t)) + v_n(t),确保在翻译过程中生理信号得以保留。
- 训练基于GAN的生成器,将真实浅肤色视频映射为逼真的深肤色外观,损失函数同时强制实现视觉真实感与信号保真度。
- 使用MTCNN进行人脸检测并裁剪面部区域至80×80分辨率,采用批量归一化和带有余弦退火的Adam优化。
- 使用VITAL和UBFC-RPPG数据集进行训练与评估,真实PPG信号来自脉搏血氧仪和ECG监护仪。
实验结果
研究问题
- RQ1当真实数据稀缺时,合成数据增强是否能有效提升rPPG在深肤色受试者中的性能?
- RQ2在肤色翻译过程中保留脉动信号是否能带来比标准图像翻译更好的生理信号估计效果?
- RQ3与仅使用真实数据训练相比,所提出方法在rPPG模型中减少人口统计偏差的程度如何?
- RQ4联合优化框架是否能在域迁移过程中同时保持视觉真实感与生理信号准确性?
主要发现
- 与仅使用真实数据训练的模型相比,该方法使深肤色受试者的平均绝对误差(MAE)降低了约31%。
- 该方法在所有人口群体中实现了46%的偏差缓解改善,表明性能更具公平性。
- 使用该方法生成的合成视频表现出逼真的像素强度变化,与真实视频高度匹配,且在保留脉动信号方面优于基线肤色翻译方法。
- 联合优化框架成功将肤色翻译与脉动信号保留解耦,使合成数据中能够实现准确的生理信号估计。
- 在UBFC-RPPG和VITAL数据集上,该方法在MAE、RMSE、PCC和SNR方面均优于传统的rPPG算法(如POS、CHROM、ICA和3D-CNN模型)。
- 该方法可在无需从代表性不足群体中收集真实世界数据的情况下,生成多样化且逼真的rPPG训练数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。