[論文レビュー] Contrast-Phys+: Unsupervised and Weakly-supervised Video-based Remote Physiological Measurement via Spatiotemporal Contrast
Contrast-Phys+ は、空間的類似性、時間的整合性、異なる動画間の相違性、および心拍数範囲制約(40–250 bpm)といった rPPG 専用の事前知識を組み込んだ時空間的対照学習を用いる、新しい非教師ありおよび弱教師ありの動画ベース遠隔光容積脈波計測(rPPG)手法である。教師なしや部分的・不整合なラベルが与えられた状況でも、自己教師あり学習による精度、ノイズ耐性、計算効率の面で最先端の性能を達成し、教師あり SOTA メソッドを上回る。
Video-based remote physiological measurement utilizes facial videos to measure the blood volume change signal, which is also called remote photoplethysmography (rPPG). Supervised methods for rPPG measurements have been shown to achieve good performance. However, the drawback of these methods is that they require facial videos with ground truth (GT) physiological signals, which are often costly and difficult to obtain. In this paper, we propose Contrast-Phys+, a method that can be trained in both unsupervised and weakly-supervised settings. We employ a 3DCNN model to generate multiple spatiotemporal rPPG signals and incorporate prior knowledge of rPPG into a contrastive loss function. We further incorporate the GT signals into contrastive learning to adapt to partial or misaligned labels. The contrastive loss encourages rPPG/GT signals from the same video to be grouped together, while pushing those from different videos apart. We evaluate our methods on five publicly available datasets that include both RGB and Near-infrared videos. Contrast-Phys+ outperforms the state-of-the-art supervised methods, even when using partially available or misaligned GT signals, or no labels at all. Additionally, we highlight the advantages of our methods in terms of computational efficiency, noise robustness, and generalization. Our code is available at https://github.com/zhaodongsun/contrast-phys.
研究の動機と目的
- 教師あり rPPG 学習のための真の生理的信号(GT)の取得にかかる高コストと困難さに対処すること。
- 非教師あり、弱教師あり、半教師ありの設定においても効果的に機能する統一フレームワークの開発。
- 完全にラベル化されたデータを必要とせずに、ノイズ、頭部の動き、ラベルの不整合に対する耐性を向上させること。
- 実世界の rPPG 応用における汎化性能と計算効率の向上。
提案手法
- 顔面動画クリップから複数の時空間的 rPPG 信号を抽出するために 3D CNN を使用する。
- 同じ動画からの rPPG 信号をグループ化し、異なる動画からの信号を分離する対照的損失関数を設計する。
- rPPG の事前知識(空間的類似性、時間的整合性、異なる動画間の相違性、心拍数範囲 40–250 bpm)を対照的目的関数に統合する。
- 部分的または不整合な GT 信号を対照学習プロセスに統合することで、弱教師あり学習に適応する。
- 勾配ベースの重要度マップを用いてモデルの注目領域を解釈し、顔面の皮膚領域に注目していることを検証する。
- データ拡張を用いた対照学習により、自己教師あり学習とラベル効率を実現し、エンドツーエンドで訓練する。

実験結果
リサーチクエスチョン
- RQ1真の生理的信号が一切ない状況でも、動画データと rPPG 専用の事前知識のみで rPPG を正確に推定できるか?
- RQ2部分的にラベル化された、またはラベルが不整合な信号で学習した場合、完全にラベル化されたベースラインと比較してモデルの性能はどの程度か?
- RQ3rPPG 専用の事前知識を組み込むことで、ノイズや運動アーチファクトに対する耐性がどの程度向上するか?
- RQ4微調整なしで、未観測のデータセットや動画条件に対してもモデルの汎化性能は十分に高いか?
- RQ5対照学習の目的関数が、信号品質の向上とモデルの解釈可能性にどのように寄与するか?
主な発見
- UBFC-rPPG データセットにおいて、ノイズを注入しない状況で、Contrast-Phys+ は平均絶対誤差(MAE)が 0.64 bpm を達成し、同じ条件下で Gideon2021(1.85 bpm)を上回った。
- 動画に周期的なノイズを注入した場合、Contrast-Phys+ は MAE が 0.74 bpm を維持した一方、Gideon2021 は 22.47 bpm まで劣化し、優れたノイズ耐性を示した。
- 完全にラベルなし(0% ラベル)の状況でも、Contrast-Phys+ は GT 信号とのピアソン相関係数が 0.991 を達成し、一部の設定では完全にラベル化された教師あり手法を上回った。
- ラベル比率が上昇するに従い、モデルの rPPG 波形は真の信号とますます一致し、100% ラベルの場合にはほぼ完全なピーク検出が達成された。
- 重要度マップにより、Contrast-Phys+ が一貫して顔面の皮膚領域に注目しているのに対し、Gideon2021 のようなベースラインはノイズや運動アーチファクトに引き寄せられることが確認された。
- 本手法は、RGB 動画および近赤外動画を含む 5 つの公開データセットにわたって良好な汎化性能を示し、強力なクロスデータセット耐性を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。