Skip to main content
QUICK REVIEW

[論文レビュー] Deep-HR: Fast Heart Rate Estimation from Face Video Under Realistic Conditions

Mohammad Sabokrou, Masoud Pourreza|arXiv (Cornell University)|Feb 12, 2020
Non-Invasive Vital Sign Monitoring参考文献 24被引用数 4
ひとこと要約

この論文では、現実的条件下の顔動画から高速かつ高精度に心拍数を推定するための深層学習ベースの手法、Deep-HRを提案する。特徴抽出(フロントエンド)と回帰(バックエンド)を分離し、敵対的に訓練されたオートエンコーダーを用いて低品質な動画フレームを精錬することで、MAHNOBで3.41のRMSE、HR-Dデータセットで6.58のRMSEを達成し、GPU上で100 FPSで実行可能である。

ABSTRACT

This paper presents a novel method for remote heart rate (HR) estimation. Recent studies have proved that blood pumping by the heart is highly correlated to the intense color of face pixels, and surprisingly can be utilized for remote HR estimation. Researchers successfully proposed several methods for this task, but making it work in realistic situations is still a challenging problem in computer vision community. Furthermore, learning to solve such a complex task on a dataset with very limited annotated samples is not reasonable. Consequently, researchers do not prefer to use the deep learning approaches for this problem. In this paper, we propose a simple yet efficient approach to benefit the advantages of the Deep Neural Network (DNN) by simplifying HR estimation from a complex task to learning from very correlated representation to HR. Inspired by previous work, we learn a component called Front-End (FE) to provide a discriminative representation of face videos, afterward a light deep regression auto-encoder as Back-End (BE) is learned to map the FE representation to HR. Regression task on the informative representation is simple and could be learned efficiently on limited training samples. Beside of this, to be more accurate and work well on low-quality videos, two deep encoder-decoder networks are trained to refine the output of FE. We also introduce a challenging dataset (HR-D) to show that our method can efficiently work in realistic conditions. Experimental results on HR-D and MAHNOB datasets confirm that our method could run as a real-time method and estimate the average HR better than state-of-the-art ones.

研究の動機と目的

  • 従来の手法がノイズ、動き、照明の変動のため失敗する、制御不能な環境下でのリモート心拍数推定の課題に対処すること。
  • モデル学習を妨げる限られたアノテーション付きトレーニングデータを前提とした、効果的な深層学習によるHR推定を可能とすること。
  • 医療やフィットネスモニタリングなどの実用的応用に適した、リアルタイムで計算効率の良い手法を開発すること。
  • 中間表現のエンドツーエンド精錬を通じて、低品質な動画入力や顔の遮蔽(例:ひげ)に対する耐性を向上させること。

提案手法

  • 本手法は2段階の深層学習フレームワークを採用する:HRに相関する特徴を顔動画フレームから抽出するフロントエンド(FE)で、HRラベル付きデータを必要としない。
  • バックエンド(BE)の回帰ネットワークは、FEの出力を心拍数にマッピングし、限られたラベル付きHRデータでのみ学習されるため、学習タスクが簡略化される。
  • 2つの敵対的に訓練されたエンコーダ・デコーダネットワーク($\mathcal{G}_1$ と $\mathcal{G}_2$)が、FEの出力と抽出された色信号を精錬し、ノイズや劣化に対する耐性を向上させる。
  • FEは自己教師ありまたは教師なし表現学習を用いて独立して学習され、血球量の変化に関連する微細な皮膚色変化を捉えることに焦点を当てる。
  • BEは、FE特徴からHRを回帰するための軽量な全結合ネットワークであり、高速な推論を可能にする。
  • システム全体はBEと精錬ネットワークの共同最適化によりエンドツーエンドで学習され、生成的敵対的学習を活用して信号品質を向上させる。

実験結果

リサーチクエスチョン

  • RQ1限られたラベル付きトレーニングデータしかない状況下でも、深層学習ベースの手法が顔動画からの正確な心拍数推定を達成できるか?
  • RQ2アノテーション付き動画データの不足を考慮しても、深層ニューラルネットワークを効果的にHR推定に活用できるか?
  • RQ3敵対的精錬ネットワークは、ノイズ、動き、または顔のひげなどの低品質な動画条件下でもHR推定の耐性を向上させられるか?
  • RQ4従来の信号処理パイプラインを凌駕する、リアルタイムでエンドツーエンドの深層学習システムを設計できるか?

主な発見

  • Deep-HRはMAHNOBデータセットでテストRMSEが3.41を達成し、先行研究の最良手法(RMSE 4.07~25.9)をすべて上回った。
  • 新たに導入されたHR-Dデータセットでは、RMSEが6.58に達し、過去の手法(最大RMSE 24.71)を著しく上回った。
  • GeForce GTX 1080 GPU上で100フレーム/秒で実行可能であり、実用的展開に向けたリアルタイム性を裏付けた。
  • 敵対的精錬ネットワーク($\mathcal{G}_1$ と $\mathcal{G}_2$)はノイズを効果的に低減し、劣化した顔領域を回復させ、信号品質と推定精度を向上させた。
  • ひげやひげの生えた顔の遮蔽に対しても、従来手法がROIのピクセル色変化に敏感であるのに対し、本手法はその影響に強く、耐性を示した。
  • MAHNOBデータセットでは相関係数($r$)が0.92を達成し、予測値と真値のHRが強く一致していることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。