Skip to main content
QUICK REVIEW

[论文解读] SCAMPS: Synthetics for Camera Measurement of Physiological Signals

Daniel McDuff, Miah Wander|arXiv (Cornell University)|Jun 8, 2022
Non-Invasive Vital Sign Monitoring被引用 19
一句话总结

SCAMPS 引入了一个包含 2,800 个高保真视频序列的合成数据集,其中精确对齐了生理信号——心率和呼吸波形、面部动作单元以及头部姿态,同时包含 RGB 帧和语义分割图。仅在该合成数据上进行训练的模型在真实世界数据集上表现出可泛化的性能,证明了基于摄像头的生理感知中从仿真到现实的迁移可行性。

ABSTRACT

The use of cameras and computational algorithms for noninvasive, low-cost and scalable measurement of physiological (e.g., cardiac and pulmonary) vital signs is very attractive. However, diverse data representing a range of environments, body motions, illumination conditions and physiological states is laborious, time consuming and expensive to obtain. Synthetic data have proven a valuable tool in several areas of machine learning, yet are not widely available for camera measurement of physiological states. Synthetic data offer "perfect" labels (e.g., without noise and with precise synchronization), labels that may not be possible to obtain otherwise (e.g., precise pixel level segmentation maps) and provide a high degree of control over variation and diversity in the dataset. We present SCAMPS, a dataset of synthetics containing 2,800 videos (1.68M frames) with aligned cardiac and respiratory signals and facial action intensities. The RGB frames are provided alongside segmentation maps. We provide precise descriptive statistics about the underlying waveforms, including inter-beat interval, heart rate variability, and pulse arrival time. Finally, we present baseline results training on these synthetic data and testing on real-world datasets to illustrate generalizability.

研究动机与目标

  • 通过生成多样化、受控的合成数据,解决基于摄像头的生理信号测量在真实世界数据集中存在的稀缺性和偏差问题。
  • 克服真实数据集的局限性,包括高昂成本、劳动密集性以及受试者外貌、光照和运动方面的多样性不足。
  • 提供一个完全标注、可控制且可扩展的合成数据集,以支持视觉化生理感知模型的训练与评估。
  • 推动从合成数据到真实世界数据泛化的研究,减少对昂贵且涉及隐私敏感的真实数据采集的依赖。
  • 通过在肤色、环境和生理参数方面实现可控变化,支持开发更加公平和鲁棒的模型。

提出的方法

  • 使用基于物理的渲染流程生成 2,800 个合成视频序列,对受试者外貌、光照和运动进行受控变化。
  • 同步生成包括光电容积脉搏波(PPG)、心电图(ECG)、呼吸和相邻心跳间隔在内的生理波形,并实现精确的帧级对齐。
  • 利用三维可变形模型和动画系统,将面部动作单元、眨眼和头部姿态作为时间对齐的标签进行整合。
  • 为每个视频帧渲染高保真的 RGB 帧及相应的语义分割图,以支持密集监督。
  • 使用参数化模型控制数据集中肤色、照明和环境背景的多样性。
  • 仅在 SCAMPS 数据上训练基线模型,并在真实世界基准数据集(UBFC、MMSE-HR)上评估泛化性能,以评估仿真到现实的迁移效果。

实验结果

研究问题

  • RQ1具有精确、无噪声生理标注的合成数据是否能够有效训练基于摄像头的生理感知模型?
  • RQ2仅在合成数据上训练的模型在真实世界、非受限视频数据上的泛化能力达到何种程度?
  • RQ3合成数据中外貌、光照和生理参数的受控变化在多大程度上影响模型的鲁棒性和公平性?
  • RQ4在 UBFC 和 MMSE-HR 等真实世界数据集上评估时,SCAMPS 训练的模型性能如何?
  • RQ5合成数据是否能够缓解真实世界数据集中与肤色、运动和环境多样性相关的偏差?

主要发现

  • 仅在 SCAMPS 合成数据上训练的模型在 UBFC 数据集上实现心率估计的平均绝对误差(MAE)为 5.42 bpm,在 MMSE-HR 数据集上为 4.59 bpm。
  • 心率估计的皮尔逊相关系数(ρ)在 UBFC 上达到 0.72,在 MMSE-HR 上达到 0.81,表明与真实值具有较强的线性一致性。
  • 在某些指标上,仅在 SCAMPS 上训练的基线模型优于部分无监督方法,证明了合成数据在训练鲁棒模型方面的潜力。
  • 结果证实,从合成数据到真实世界数据的泛化是可行的,尽管性能仍低于当前最先进的无监督方法。
  • 包含精确帧级标注(如 PPG、ECG、呼吸波形和面部动作单元)可实现高保真监督,有利于模型训练。
  • 该数据集支持在不同肤色、光照和运动条件下对模型行为进行受控评估,有助于推动公平性和鲁棒性研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。