Skip to main content
QUICK REVIEW

[论文解读] Self-supervised Representation Learning Framework for Remote Physiological Measurement Using Spatiotemporal Augmentation Loss

Hao Wang, Euijoon Ahn|arXiv (Cornell University)|Jul 16, 2021
Non-Invasive Vital Sign Monitoring被引用 4
一句话总结

该论文提出了一种用于面部视频远程生理测量的自监督表征学习框架 SLF-RPM,无需标注数据。它通过 Shafer 的二色反射模型引入基于关键点的空间增强,并利用奈奎斯特-香农采样定理实现基于稀疏性的时序增强,结合约束性时空损失以学习鲁棒的 rPPG 特征,在三个公开数据集上达到最先进性能,并在与监督方法的对比中展现出具有竞争力的准确性。

ABSTRACT

Recent advances in supervised deep learning methods are enabling remote measurements of photoplethysmography-based physiological signals using facial videos. The performance of these supervised methods, however, are dependent on the availability of large labelled data. Contrastive learning as a self-supervised method has recently achieved state-of-the-art performances in learning representative data features by maximising mutual information between different augmented views. However, existing data augmentation techniques for contrastive learning are not designed to learn physiological signals from videos and often fail when there are complicated noise and subtle and periodic colour or shape variations between video frames. To address these problems, we present a novel self-supervised spatiotemporal learning framework for remote physiological signal representation learning, where there is a lack of labelled training data. Firstly, we propose a landmark-based spatial augmentation that splits the face into several informative parts based on the Shafer dichromatic reflection model to characterise subtle skin colour fluctuations. We also formulate a sparsity-based temporal augmentation exploiting Nyquist-Shannon sampling theorem to effectively capture periodic temporal changes by modelling physiological signal features. Furthermore, we introduce a constrained spatiotemporal loss which generates pseudo-labels for augmented video clips. It is used to regulate the training process and handle complicated noise. We evaluated our framework on 3 public datasets and demonstrated superior performances than other self-supervised methods and achieved competitive accuracy compared to the state-of-the-art supervised methods.

研究动机与目标

  • 为解决远程光电容积脉搏波(rPPG)中大规模标注数据缺乏的问题,提出一种自监督表征学习框架。
  • 通过设计针对 rPPG 特性的领域特定数据增强方法,改进对微弱生理信号的特征学习。
  • 通过一种新型约束性时空损失,增强对复杂噪声以及面部视频中周期性颜色/形状变化的鲁棒性。
  • 在不依赖任何标注生理标签的前提下,实现与监督最先进方法相当的性能。

提出的方法

  • 提出一种基于关键点的空间增强方法,利用 Shafer 的二色反射模型将人脸划分为区域,以捕捉细微的皮肤颜色波动。
  • 引入一种基于稀疏性的时序增强方法,通过利用奈奎斯特-香农采样定理来建模周期性 rPPG 信号特征。
  • 设计一种约束性时空损失函数,从增强的视频片段中生成伪标签,以指导对比学习并稳定训练过程。
  • 使用三维卷积神经网络从原始视频片段中提取时空特征,先进行自监督预训练,随后进行线性评估与迁移学习。
  • 采用动量对比学习框架,其中正样本对由所提出的增强方法生成,负样本对则从同一批次中采样。
  • 应用一个包含 2048 或 512 个输出维度的多层感知机头,将特征投影到潜在空间以优化对比学习。

实验结果

研究问题

  • RQ1自监督学习框架是否能有效学习代表性 rPPG 特征,而无需依赖大规模标注数据?
  • RQ2领域特定的空间与时序增强方法在学习面部视频中微弱生理信号变化方面有何提升作用?
  • RQ3约束性时空损失在增强对噪声的鲁棒性及提升远程生理测量性能方面达到何种程度?
  • RQ4所提出的框架在公开 rPPG 基准测试中与最先进监督与自监督方法相比表现如何?

主要发现

  • 在 MAHNOB-HCI、UBFC-rPPG 和 VIPL-HR-V2 数据集上,SLF-RPM 在心率估计准确性方面优于所有其他自监督对比学习方法。
  • 在 MAHNOB-HCI 数据集上,该方法在线性评估中实现了 0.82 bpm 的平均绝对误差(MAE),超越了先前最先进自监督方法。
  • 在 UBFC-rPPG 数据集上,该方法实现了 0.91 bpm 的 MAE,展现出对噪声和运动的强大泛化能力与鲁棒性。
  • 在具有挑战性的 VIPL-HR-V2 数据集上,该方法实现了 1.05 bpm 的 MAE,与最先进监督模型相比具有竞争力。
  • 消融实验证实,空间与时序增强均显著提升性能,且约束损失有效改善了训练稳定性。
  • 迁移学习实验在所有数据集上均显示出一致的性能提升,表明所学表征具有泛化能力,且在下游任务中有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。