[論文レビュー] Self-supervised Representation Learning Framework for Remote Physiological Measurement Using Spatiotemporal Augmentation Loss
本稿では、ラベル付きデータを必要とせず、顔の動画を用いた遠隔生理測定のための自己教師あり表現学習フレームワーク、SLF-RPMを提案する。ランドマークに基づく空間拡張(Shaferの二色反射モデルを用いて)、およびNyquist–Shannonの定理を活用したスパarsityに基づく時間的拡張を導入し、制約付き時空間損失を組み合わせることで、頑健なrPPG特徴を学習する。3つの公的データセットで最先端の性能を達成し、教師あり手法と同等の精度を示した。
Recent advances in supervised deep learning methods are enabling remote measurements of photoplethysmography-based physiological signals using facial videos. The performance of these supervised methods, however, are dependent on the availability of large labelled data. Contrastive learning as a self-supervised method has recently achieved state-of-the-art performances in learning representative data features by maximising mutual information between different augmented views. However, existing data augmentation techniques for contrastive learning are not designed to learn physiological signals from videos and often fail when there are complicated noise and subtle and periodic colour or shape variations between video frames. To address these problems, we present a novel self-supervised spatiotemporal learning framework for remote physiological signal representation learning, where there is a lack of labelled training data. Firstly, we propose a landmark-based spatial augmentation that splits the face into several informative parts based on the Shafer dichromatic reflection model to characterise subtle skin colour fluctuations. We also formulate a sparsity-based temporal augmentation exploiting Nyquist-Shannon sampling theorem to effectively capture periodic temporal changes by modelling physiological signal features. Furthermore, we introduce a constrained spatiotemporal loss which generates pseudo-labels for augmented video clips. It is used to regulate the training process and handle complicated noise. We evaluated our framework on 3 public datasets and demonstrated superior performances than other self-supervised methods and achieved competitive accuracy compared to the state-of-the-art supervised methods.
研究の動機と目的
- 遠隔光容積脈波計測(rPPG)における大規模ラベル付きデータの不足に応じ、自己教師あり表現学習フレームワークの開発。
- rPPGの特性に特化したドメイン固有のデータ拡張を設計することで、微細な生理的信号の特徴学習を向上。
- 顔の動画における複雑なノイズおよび周期的な色・形状変動に対して、新たな制約付き時空間損失により耐性を高める。
- いかなる生理的ラベルのアノテーションを必要とせず、教師あり最先端手法と同等の性能を達成すること。
提案手法
- 顔をShaferの二色反射モデルを用いて領域に分割するランドマークに基づく空間拡張を提案し、微細な皮膚色の変動を捉える。
- Nyquist–Shannonの標本化定理を活用して、周期的なrPPG信号特徴をモデル化するスパarsityに基づく時間的拡張を導入。
- 拡張されたクリップから擬似ラベルを生成する制約付き時空間損失関数を設計し、対照的学習をガイドし、学習の安定化を図る。
- 生動画クリップから時空間特徴を抽出するために3次元畳み込みニューラルネットワークを用い、自己教師あり事前学習の後、線形評価および転移学習を実施。
- モーメンタム対照的学習フレームワークを採用し、正例ペアは提案された拡張によって生成され、負例ペアは同じバッチから抽出される。
- 対照的最適化のための潜在空間に特徴を投影するために、2048または512次元の出力を持つ多層パーセプトロンヘッドを適用。
実験結果
リサーチクエスチョン
- RQ1大規模ラベル付きデータに依存せずに、自己教師あり学習フレームワークが代表的なrPPG特徴を効果的に学習できるか。
- RQ2ドメイン固有の空間的および時間的拡張が、顔の動画における微細な生理的信号変動の学習をどの程度向上させるか。
- RQ3制約付き時空間損失がノイズへの耐性を高め、遠隔生理測定における性能をどの程度向上させるか。
- RQ4提案フレームワークは、公的rPPGベンチマークにおいて、最先端の教師ありおよび自己教師あり手法と比較してどの程度の性能を示すか。
主な発見
- SLF-RPMは、MAHNOB-HCI、UBFC-rPPG、VIPL-HR-V2の3つのデータセットにおいて、他のすべての自己教師あり対照的学習手法を上回る心拍数推定精度を達成した。
- MAHNOB-HCIデータセットでは、線形評価で平均絶対誤差(MAE)が0.82 bpmを達成し、以前のSOTA SSL手法を上回った。
- UBFC-rPPGデータセットでは、MAEが0.91 bpmに達し、ノイズおよび動きに強く、優れた一般化性能を示した。
- 挑戦的なVIPL-HR-V2データセットでは、MAEが1.05 bpmに達し、最先端の教師ありモデルと同等の性能を示した。
- アブレーションスタディにより、空間的および時間的拡張の両方が性能向上に顕著に寄与することが確認され、制約付き損失が学習の安定性を向上させた。
- 転移学習実験では、すべてのデータセットで一貫した性能向上が得られ、学習された表現が一般化可能で、下流タスクに有効であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。