Skip to main content
QUICK REVIEW

[論文レビュー] Contrast-Phys: Unsupervised Video-based Remote Physiological Measurement via Spatiotemporal Contrast

Zhaodong Sun, Xiaobai Li|arXiv (Cornell University)|Aug 8, 2022
Non-Invasive Vital Sign Monitoring参考文献 57被引用数 4
ひとこと要約

本稿では、顔映像から心拍数などの生理的信号を推定するために、教師なしの動画ベース遠隔脈波計測(rPPG)手法であるContrast-Physを提案する。この手法は、同一動画内における空間的・時間的領域間のrPPG信号類似性と、異なる動画間の非類似性を活用した時空間的対照的学習を採用しており、教師データが不要である。このアプローチにより、最先端の教師ありrPPGモデルと同等の性能を達成するとともに、著しく高速かつノイズに強く、性能を発揮する。

ABSTRACT

Video-based remote physiological measurement utilizes face videos to measure the blood volume change signal, which is also called remote photoplethysmography (rPPG). Supervised methods for rPPG measurements achieve state-of-the-art performance. However, supervised rPPG methods require face videos and ground truth physiological signals for model training. In this paper, we propose an unsupervised rPPG measurement method that does not require ground truth signals for training. We use a 3DCNN model to generate multiple rPPG signals from each video in different spatiotemporal locations and train the model with a contrastive loss where rPPG signals from the same video are pulled together while those from different videos are pushed away. We test on five public datasets, including RGB videos and NIR videos. The results show that our method outperforms the previous unsupervised baseline and achieves accuracies very close to the current best supervised rPPG methods on all five datasets. Furthermore, we also demonstrate that our approach can run at a much faster speed and is more robust to noises than the previous unsupervised baseline. Our code is available at https://github.com/zhaodongsun/contrast-phys.

研究の動機と目的

  • トレーニング中に高価な教師付き生理的信号を必要としない教師なしrPPG手法の開発。
  • 周期的ノイズや頭部の動きによる劣化を軽減する、既存の教師なしrPPG手法の耐性向上。
  • 教師付き生理的信号が一切不要な状況でも、教師ありrPPGモデルと同等の性能を達成すること。
  • 従来の自己教師ありアプローチで使用される重複するモデル順方向伝搬を回避することで、トレーニング効率の向上。

提案手法

  • 本手法は、1つの動画から空間的(高さ、幅)および時間的(時間)次元にわたる複数のrPPG信号を抽出できる、時空間的rPPG(ST-rPPG)ブロック表現を導入する。
  • 3次元畳み込みニューラルネットワーク(3D CNN)バックボーンを用いて動画クリップを処理し、ST-rPPG特徴量を生成することで、rPPG信号の空間的および時間的統合モデリングを可能にする。
  • 対照的学習を、同一動画からのrPPG信号(ポジティブペア)を引き寄せる一方で、異なる動画間の信号(ネガティブペア)を遠ざける対照的損失関数を用いて実装する。
  • 本手法は4つのrPPGの観察事項を活用する:顔面領域間でのrPPG信号の空間的類似性、短いクリップ内での時間的類似性、異なる動画間での非類似性、および心拍数の有界範囲(0.66–4.16 Hz)。
  • 時空間的サンプリングにより、同じ動画内で異なる空間的・時間的位置からポジティブペアを生成し、異なる動画間でネガティブペアを形成する。
  • 教師付きラベルが一切不要な状況で、対照的損失関数をエンドツーエンド最適化することで、トレーニングを実現する。

実験結果

リサーチクエスチョン

  • RQ1顔映像から教師付き生理的ラベルが一切ない状況でも、rPPG信号を正確に推定できるか?
  • RQ2時空間的対照的学習は、rPPGに内在する信号の規則性を効果的に活用し、教師なし表現学習を可能にするか?
  • RQ3本手法は、既存の教師なしrPPGベースラインと比較して、精度・速度・ノイズ耐性において優れているか?
  • RQ4ST-rPPGブロック構築に最適な時空間的解像度とクリップ長さは何か?

主な発見

  • Contrast-Physは、5つの公的データセットすべてにおいて、以前の教師なしベースライン[Gideon2021]を上回り、UBFC-rPPGデータセットでは平均絶対誤差(MAE)が0.64 bpmにまで低下した。これは、前回の手法が1.85 bpmであったのと比較して顕著な改善である。
  • UBFC-rPPGデータセットでは、Contrast-PhysがR値0.995を達成し、最高の教師ありrPPG手法とほぼ同等の精度を示した。
  • 周期的ノイズを注入した状況でも、Contrast-PhysはMAEが0.74 bpm、R値が0.991を維持した。一方、Gideon2021はMAEが22.47 bpm、R値が0.244に劣化した。
  • 重複する順方向伝搬を回避することで、従来の教師なしアプローチよりも著しく高速に動作する。
  • 感度分析の結果、2×2の空間解像度と10秒の時間長さが、受容場と信号品質のバランスを最適にした。
  • 類似度マップの結果、Contrast-Physはノイズや頭部の動きがあっても顔面の皮膚領域に正しく注目しているのに対し、Gideon2021は不規則でノイズに敏感な注目パターンを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。