Skip to main content
QUICK REVIEW

[論文レビュー] PhysFormer: Facial Video-based Physiological Measurement with Temporal Difference Transformer

Zitong Yu, Yuming Shen|arXiv (Cornell University)|Nov 23, 2021
Non-Invasive Vital Sign Monitoring参考文献 70被引用数 13
ひとこと要約

本稿では、長距離の空間時間的文脈において準周期的rPPG特徴を強化するために、時間的差分を用いたグローバルアテンションを活用するエンドツーエンドの動画トランスフォーマー・アーキテクチャ、PhysFormerを提案する。ImageNetの事前学習を一切用いずに、複数のベンチマークデータセットで最先端の性能を達成し、インtraおよびクロスデータセット評価において強力な汎化性と耐障害性を示している。

ABSTRACT

Remote photoplethysmography (rPPG), which aims at measuring heart activities and physiological signals from facial video without any contact, has great potential in many applications (e.g., remote healthcare and affective computing). Recent deep learning approaches focus on mining subtle rPPG clues using convolutional neural networks with limited spatio-temporal receptive fields, which neglect the long-range spatio-temporal perception and interaction for rPPG modeling. In this paper, we propose the PhysFormer, an end-to-end video transformer based architecture, to adaptively aggregate both local and global spatio-temporal features for rPPG representation enhancement. As key modules in PhysFormer, the temporal difference transformers first enhance the quasi-periodic rPPG features with temporal difference guided global attention, and then refine the local spatio-temporal representation against interference. Furthermore, we also propose the label distribution learning and a curriculum learning inspired dynamic constraint in frequency domain, which provide elaborate supervisions for PhysFormer and alleviate overfitting. Comprehensive experiments are performed on four benchmark datasets to show our superior performance on both intra- and cross-dataset testings. One highlight is that, unlike most transformer networks needed pretraining from large-scale datasets, the proposed PhysFormer can be easily trained from scratch on rPPG datasets, which makes it promising as a novel transformer baseline for the rPPG community. The codes will be released at https://github.com/ZitongYu/PhysFormer.

研究の動機と目的

  • 局所的受容 field に依存する既存のrPPG手法の限界を解消し、長距離の空間時間的依存関係をモデル化できない点に起因する課題を解決すること。
  • 顔面動画からのグローバルな文脈的手がかりを捉えることのできるエンドツーエンドのディープラーニングフレームワークを構築し、生理的信号推定を向上させること。
  • 低監督状況下で内在的なrPPGに特化した特徴の学習を促進し、過学習を軽減するための監督戦略を設計すること。
  • ImageNet やその他の大規模な事前学習に依存せずに、スクラッチから効果的な学習を可能にし、トランスフォーマー時代におけるrPPGの新たなベースラインを確立すること。

提案手法

  • 微細な時間的皮膚色差を用いて、長距離の空間時間的関係をモデル化する、段階的な時間的差分トランスフォーマー(TD-Transformer)バックボーンを導入する。
  • 時間的差分マルチヘッド自己アテンション(TD-MHSA)を採用し、フレームおよび領域間で類似した信号トレンドに注目することで、準周期的rPPG信号を強化する。
  • 生理的信号ラベルの不確実性をモデル化するため、ラベル分布学習を適用し、ノイズの多いアノテーションに対しても耐性を高める。
  • カリキュラム学習にインspiredされた周波数ドメインにおける動的損失を導入し、指数関数的に増加する重み付けを用いて訓練をガイドし、過学習を低減する。
  • 連続するフレーム間の空間時間的領域を表すために、チューブベースのトークナイゼーションを採用し、効率的な動画シーケンスモデリングを実現する。
  • ImageNet やその他の大規模な事前学習に依存せずに、rPPGデータセット上でスクラッチからエンドツーエンドでモデルを学習する。

実験結果

リサーチクエスチョン

  • RQ1動画トランスフォーマー・アーキテクチャは、rPPG測定のための顔面動画において、長距離の空間時間的依存関係を効果的にモデル化できるか?
  • RQ2局所的畳み込みや標準的な自己アテンションと比較して、時間的差分を用いたグローバルアテンションは、rPPG特徴抽出をどのように向上させるか?
  • RQ3動的周波数ドメイン監督は、低監督状況下のrPPG学習において、モデルの汎化性を向上させるとともに過学習を軽減できるか?
  • RQ4PhysFormerは、ImageNet-21K などの大規模データセットでの事前学習なしに、最先端の性能を達成できるか?
  • RQ5ヘッド数や深さといったアーキテクチャのハイパーパrameterは、モデルの性能および耐障害性にどのように影響を与えるか?

主な発見

  • PhysFormerは、ImageNetの事前学習を一切用いずに、VIPL-HR や rPPG用データセットなど4つのベンチマークデータセットで優れた、あるいは最先端の性能を達成した。
  • 指数関数的に増加するβを用いた動的周波数ドメイン監督を施したモデルは、固定または線形に増加する戦略よりも、収束が早く、RMSEが低かった。
  • 時間的差分モジュールにおいてθ = 0.4 または 0.7 が最適な性能を達成した。これは、正規化された局所的時間的勾配がアテンションに重要であることを示している。
  • 4つのアテンションヘッドを用いることで最良の性能が得られ、ヘッド数が少ない場合、性能が著しく低下した。これは、rPPGパターンのマルチヘッドモデリングの必要性を強調している。
  • TD-Transformerブロックを増やした深層ネットワークは、RMSEを段階的に低下させるが、計算コストが増加する。
  • アテンション可視化の結果、モデルは生理的に関連する領域(例:額、頬)に注目しており、周期的なrPPG信号トレンドと整合していることが確認されたが、一部のノイズや位相シフトされた反応も残存していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。