Skip to main content
QUICK REVIEW

[論文レビュー] Facial Video-based Remote Physiological Measurement via Self-supervised Learning

Zijie Yue, Miaojing Shi|arXiv (Cornell University)|Oct 27, 2022
Non-Invasive Vital Sign Monitoring被引用数 6
ひとこと要約

本論文は、同期された顔面動画とPPG信号のデータセットが限られている課題に対処し、真のPPG信号を必要とせずに顔面動画からの自己教師付きrPPG測定フレームワークを提案する。周波数に敏感なデータ拡張、局所的rPPGエキスパート集約、周波数に起因する損失関数を活用することで、5つのベンチマークで心拍数、HRV、呼吸周波数推定において最先端の性能を達成した。

ABSTRACT

Facial video-based remote physiological measurement aims to estimate remote photoplethysmography (rPPG) signals from human face videos and then measure multiple vital signs (e.g. heart rate, respiration frequency) from rPPG signals. Recent approaches achieve it by training deep neural networks, which normally require abundant facial videos and synchronously recorded photoplethysmography (PPG) signals for supervision. However, the collection of these annotated corpora is not easy in practice. In this paper, we introduce a novel frequency-inspired self-supervised framework that learns to estimate rPPG signals from facial videos without the need of ground truth PPG signals. Given a video sample, we first augment it into multiple positive/negative samples which contain similar/dissimilar signal frequencies to the original one. Specifically, positive samples are generated using spatial augmentation. Negative samples are generated via a learnable frequency augmentation module, which performs non-linear signal frequency transformation on the input without excessively changing its visual appearance. Next, we introduce a local rPPG expert aggregation module to estimate rPPG signals from augmented samples. It encodes complementary pulsation information from different face regions and aggregate them into one rPPG prediction. Finally, we propose a series of frequency-inspired losses, i.e. frequency contrastive loss, frequency ratio consistency loss, and cross-video frequency agreement loss, for the optimization of estimated rPPG signals from multiple augmented video samples and across temporally neighboring video samples. We conduct rPPG-based heart rate, heart rate variability and respiration frequency estimation on four standard benchmarks. The experimental results demonstrate that our method improves the state of the art by a large margin.

研究の動機と目的

  • rPPGモデルの学習に必要な同期された顔面動画とPPG信号のデータセットが限られているという課題に対処すること。
  • 真のPPG信号を必要とせず、ペアでない顔面動画から自己教師付きrPPG推定を可能にすること。
  • 特に多様な民族的背景や照明条件において、モデルの汎化性と耐性を向上させること。
  • 時間的・周波数的変動からrPPG信号を学習するのに効果的な、周波数に敏感なデータ拡張と損失関数の設計をすること。

提案手法

  • 視覚的外観を保持しつつ、信号周波数を非線形に変換する学習可能な周波数拡張(LFA)モジュールを導入する。
  • 空間的拡張(例:回転、反転)を適用して、同一のrPPG周波数を持つポジティブサンプルを生成する。
  • 局所的rPPGエキスパート集約(REA)モジュールを採用し、領域固有の脈動信号を抽出し、領域アテンションと空間的・時間的ゲーティングを用いて統合する。
  • 周波数に起因する3つの損失関数を設計:周波数対照的損失、周波数比一貫性損失、および複数動画間の周波数一致損失を用いてrPPG推定を最適化する。
  • ペアのPPGアノテーションが一切不要な状態で、顔面動画クリップのみを用いてエンドツーエンドにモデルを訓練する。
  • 隣接する動画クリップを追加のポジティブサンプルとして用い、周波数の一貫性とモデルの耐性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1自己教師付き学習は、同期された真のPPG信号を必要とせず、rPPGモデルを効果的に学習できるか?
  • RQ2対照的学習における固定比リサンプリングと比較して、学習可能な周波数拡張はモデルの汎化性をどのように向上させるか?
  • RQ3局所的rPPGエキスパート集約モジュールは、多様な顔面領域からの信号抽出をどの程度向上させるか?
  • RQ4周波数に起因する損失関数は、多様な被験者や動画クリップにおいてrPPG推定の精度と一貫性をどのように向上させるか?
  • RQ5特に暗い肌色の被験者において信号対雑音比が低い状況下で、モデルの性能はどのように変化するか?

主な発見

  • 提案手法は5つの標準的なrPPGベンチマークで最先端の性能を達成し、先行の教師ありおよび自己教師あり手法を上回った。
  • BP4D+データセットにおいて、アジア系被験者では心拍数推定の平均絶対誤差(MAE)が2.54を達成し、Gideonら[20]を0.68 MAE上回った。
  • アフリカ系被験者ではMAEが4.69を記録し、Gideonら[20]を0.46 MAE上回ったが、暗い肌色のピクセル飽和の影響により性能は依然として低かった。
  • 白人系被験者ではMAEが2.89を示し、既存のSOTAを著しく上回った。
  • 定性的な分析から、特にアジア系および白人系被験者において、信号の周期性が向上し、心拍間隔のばらつきが減少していることが確認された。
  • バランスの取れた民族的背景のサブセットを用いた実験から、アフリカ系被験者における性能低下は主にカメラ感度の制限が暗い肌色の信号取得に影響を与えていることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。