[論文レビュー] PhysFormer++: Facial Video-based Physiological Measurement with SlowFast Temporal Difference Transformer
本稿では、顔面動画からの接触なし生理的測定を目的としたエンドツーエンドの動画変換器アーキテクチャであるPhysFormerおよびPhysFormer++を提案する。時間的差分変換器とグローバルアテンション、およびSlowFast二重パスウェイ設計を活用することで、周期的rPPG信号の強化と、動き、照明、動画劣化に対するロバスト性の向上を実現し、事前学習を用いずにベンチマークデータセットで最先端の性能を達成した。
Remote photoplethysmography (rPPG), which aims at measuring heart activities and physiological signals from facial video without any contact, has great potential in many applications (e.g., remote healthcare and affective computing). Recent deep learning approaches focus on mining subtle rPPG clues using convolutional neural networks with limited spatio-temporal receptive fields, which neglect the long-range spatio-temporal perception and interaction for rPPG modeling. In this paper, we propose two end-to-end video transformer based architectures, namely PhysFormer and PhysFormer++, to adaptively aggregate both local and global spatio-temporal features for rPPG representation enhancement. As key modules in PhysFormer, the temporal difference transformers first enhance the quasi-periodic rPPG features with temporal difference guided global attention, and then refine the local spatio-temporal representation against interference. To better exploit the temporal contextual and periodic rPPG clues, we also extend the PhysFormer to the two-pathway SlowFast based PhysFormer++ with temporal difference periodic and cross-attention transformers. Furthermore, we propose the label distribution learning and a curriculum learning inspired dynamic constraint in frequency domain, which provide elaborate supervisions for PhysFormer and PhysFormer++ and alleviate overfitting. Comprehensive experiments are performed on four benchmark datasets to show our superior performance on both intra- and cross-dataset testings. Unlike most transformer networks needed pretraining from large-scale datasets, the proposed PhysFormer family can be easily trained from scratch on rPPG datasets, which makes it promising as a novel transformer baseline for the rPPG community.
研究の動機と目的
- 畳み込みニューラルネットワーク(CNN)ベースのrPPGモデルが顔面動画内の長距離時空間的依存関係および周期的ダイナミクスを捉えることの制限を解決すること。
- 時間的差分ガイドドのグローバルアテンションを用いて準周期的rPPG特徴を強化する変換器ベースのアーキテクチャの開発。
- 現実世界のrPPGモニタリング状況における頭部の動き、動画圧縮、低解像度入力に対するロバスト性の向上。
- 大規模な事前学習を用いずに、スクラッチからの有効な学習を可能にし、変換器時代におけるrPPGの新しいベースラインを確立すること。
- 訓練の安定化と過学習の低減を目的とした、新たな監督メカニズム(ラベル分布学習と周波数ドメインカリキュラム学習)の導入。
提案手法
- コアアーキテクチャは、時間的差分表現を用いて局所的およびグローバルな時空間的特徴の間でアテンションを計算する時間的差分変換器を採用する。
- 本手法は、フレーム間の相対的強度変化に注目することで、周期的rPPG信号を強化する、新しい時間的差分マルチヘッド自己アテンション(TD-MHPSA)モジュールを導入する。
- PhysFormer++は、'スローパath'が長距離の文脈を捉え、'ファストパス'が短期的ダイナミクスをモデル化するSlowFast二重パスウェイ設計を拡張して採用し、より良い特徴統合を実現する。
- クロスアテンションと周期的アテンションメカニズムを用いて、rPPG信号における繰り返しパターンに注目することで、表現を精緻化する。
- 周波数ドメインカリキュラム学習損失を適用し、段階的にモデルが周期的パターンを学習するように制約を課すことで、一般化性能の向上を図る。
- ラベル分布学習を用いてソフトターゲットでモデルを監督することで、ロバスト性の向上と過学習の低減を実現する。
実験結果
リサーチクエスチョン
- RQ1動画変換器アーキテクチャは、rPPG測定のための顔面動画における長距離時空間的依存関係を効果的にモデル化できるか?
- RQ2時間的差分特徴を組み込むことで、エンドツーエンド学習における準周期的rPPG信号のモデル化がどの程度向上するか?
- RQ3SlowFast設計は、rPPG推定における頭部の動きと動画劣化に対するロバスト性をどの程度向上させるか?
- RQ4提案手法は、大規模データセットの事前学習を用いずに最先端の性能を達成できるか?
- RQ5提案された監督メカニズム(ラベル分布学習と周波数ドメインカリキュラム学習)は、モデルの一般化性能の向上にどの程度有効か?
主な発見
- 100%のデータで学習した場合、VIPL-HRデータセットにおいてPhysFormer++はRMSE 7.62 bpmを達成し、AutoHR(8.68 bpm)とPhysFormer(7.79 bpm)を上回った。
- OBFデータセットでは、1000 kb/sの高圧縮率でも優れた性能を維持し、特に500 kb/sでrPPGNetを上回った。
- 低解像度条件(16×16)下でも、PhysFormer++はRMSE 9.58 bpmを達成し、画像劣化や長距離モニタリング状況においてもロバストであることを示した。
- 学習データの10%のみで学習した場合、PhysFormer++はRMSE 13.92 bpmを達成し、同様の低データ環境下でデータ集約型のCNNベースライン(AutoHR:15.77 bpm)と比較して競争力のある性能を示した。
- 提案されたアテンション損失($\mathcal{L}_{\text{atten}}$)により、より周期的で均一なアテンションマップが得られ、動き歪み下でもモデルの安定性と性能が向上した。
- アブレーションスタディにより、時間的差分アテンションおよびSlowFast設計の両方が、特にクロスデータセットおよび困難な現実世界設定下で性能向上に顕著に寄与することが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。