Skip to main content
QUICK REVIEW

[논문 리뷰] Deep-HR: Fast Heart Rate Estimation from Face Video Under Realistic Conditions

Mohammad Sabokrou, Masoud Pourreza|arXiv (Cornell University)|2020. 02. 12.
Non-Invasive Vital Sign Monitoring참고 문헌 24인용 수 4
한 줄 요약

이 논문은 현실적인 조건에서 얼굴 영상에서 빠르고 정확한 원격 심박수 추정을 위한 딥러닝 기반 방법인 Deep-HR을 제안한다. 특징 추출(프론트엔드)과 회귀(백엔드)를 분리하고, 저품질 영상 프레임을 개선하기 위해 적대적 학습된 오토인코더를 사용함으로써, MAHNOB에서 3.41 RMSE, 새로운 HR-D 데이터셋에서 6.58 RMSE의 최신 기술 수준 성능를 달성하면서도 GPU에서 100 FPS로 실행된다.

ABSTRACT

This paper presents a novel method for remote heart rate (HR) estimation. Recent studies have proved that blood pumping by the heart is highly correlated to the intense color of face pixels, and surprisingly can be utilized for remote HR estimation. Researchers successfully proposed several methods for this task, but making it work in realistic situations is still a challenging problem in computer vision community. Furthermore, learning to solve such a complex task on a dataset with very limited annotated samples is not reasonable. Consequently, researchers do not prefer to use the deep learning approaches for this problem. In this paper, we propose a simple yet efficient approach to benefit the advantages of the Deep Neural Network (DNN) by simplifying HR estimation from a complex task to learning from very correlated representation to HR. Inspired by previous work, we learn a component called Front-End (FE) to provide a discriminative representation of face videos, afterward a light deep regression auto-encoder as Back-End (BE) is learned to map the FE representation to HR. Regression task on the informative representation is simple and could be learned efficiently on limited training samples. Beside of this, to be more accurate and work well on low-quality videos, two deep encoder-decoder networks are trained to refine the output of FE. We also introduce a challenging dataset (HR-D) to show that our method can efficiently work in realistic conditions. Experimental results on HR-D and MAHNOB datasets confirm that our method could run as a real-time method and estimate the average HR better than state-of-the-art ones.

연구 동기 및 목표

  • 기존 방법이 노이즈, 움직임, 조도 변화로 인해 실패하는 비제어적 환경에서 원격 심박수 추정의 과제를 해결하기 위해.
  • 모델 훈련을 방해하는 제한된 레이블이 부여된 훈련 데이터로 인해 심박수 추정을 위한 효과적인 딥러닝을 가능하게 하기 위해.
  • 의료 및 피트니스 모니터링과 같은 실용적 응용 분야에 적합한 실시간이고 계산 효율적인 방법을 개발하기 위해.
  • 중간 표현의 종합적 개선을 통해 저품질 영상 입력과 얼굴 가림(예: 수염)에 대한 강건성을 향상시키기 위해.

제안 방법

  • 이 방법은 두 단계의 딥러닝 프레임워크를 사용한다: 심박수 관련 표현을 레이블이 없는 영상 프레임에서 추출하는 프론트엔드(FE)이다.
  • 백엔드(BE) 회귀 네트워크는 FE의 출력을 심박수로 매핑하며, 제한된 레이블이 부여된 심박수 데이터로만 훈련되어 학습 과제를 단순화한다.
  • 두 개의 적대적 학습된 인코더-디코더 네트워크($\mathcal{G}_1$ 및 $\mathcal{G}_2$)는 FE의 출력과 추출된 색상 신호를 개선하여 노이즈 및 열화에 대한 강건성을 향상시킨다.
  • FE는 자기지도 또는 비지도 표현 학습을 사용해 독립적으로 훈련되며, 혈액량 변화와 관련된 미세한 피부 색상 변화를 포착하는 데 집중한다.
  • BE는 FE 특징에서 심박수를 회귀하기 위한 경량의 완전 연결 네트워크로, 빠른 추론을 가능하게 한다.
  • 전체 시스템은 BE와 리파이너의 공동 최적화를 통해 엔드 투 엔드로 훈련되며, 생성적 적대적 학습을 활용해 신호 품질을 향상시킨다.

실험 결과

연구 질문

  • RQ1제한된 레이블이 부여된 훈련 데이터만 존재할 때 딥러닝 기반 접근 방식이 얼굴 영상에서 정확한 심박수 추정을 달성할 수 있는가?
  • RQ2레이블이 부여된 영상 데이터가 부족한 상황에서 딥 네트워크가 어떻게 효과적으로 심박수 추정을 위해 훈련될 수 있는가?
  • RQ3적대적 리파이너 네트워크는 노이즈, 움직임 또는 수염과 같은 저품질 영상 조건에서 심박수 추정의 강건성을 향상시킬 수 있는가?
  • RQ4기존 신호 처리 파이프라인보다 뛰어난 성능을 내는 실시간, 엔드 투 엔드 딥러닝 시스템을 설계하는 것이 가능한가?

주요 결과

  • Deep-HR는 MAHNOB 데이터셋에서 테스트 RMSE 3.41을 달성하여 이전 최신 기술 수준의 방법들(4.07에서 25.9 사이)을 모두 능가한다.
  • 최근 도입된 HR-D 데이터셋에서, 이 방법은 RMSE 6.58을 기록하여 이전 방법들이 보고한 최대 24.71의 RMSE를 크게 뛰어넘는다.
  • 이 방법은 GeForce GTX 1080 GPU에서 100 프레임 매초로 실행되어 실시간 구현 가능성을 확인한다.
  • 적대적 리파이너 네트워크($\mathcal{G}_1$ 및 $\mathcal{G}_2$)는 노이즈를 효과적으로 감소시키고 열화된 얼굴 영역을 복원하여 신호 품질과 추정 정확도를 향상시킨다.
  • 수염이나 콧수염과 같은 얼굴 가림에 대해 강건성을 보이며, 이는 이전 방법들이 ROI 내 픽셀 색상 변화에 민감하여 성능이 저하되는 이유를 고려할 때 뚜렷한 개선이다.
  • MAHNOB에서 상관계수($r$)가 0.92를 기록하여 예측된 값과 진짜 심박수 값 간의 강한 일치를 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.