Skip to main content
QUICK REVIEW

[논문 리뷰] Face2PPG: An unsupervised pipeline for blood volume pulse extraction from faces

Constantino Álvarez Casado, Miguel Bordallo López|arXiv (Cornell University)|2022. 02. 08.
Non-Invasive Vital Sign Monitoring인용 수 9
한 줄 요약

이 논문은 세 가지 새로운 구성 요소를 통해 얼굴 영상에서 혈액량 파уль스 추출을 향상시키는 비지도 rPPG 파이프라인인 Face2PPG를 제안한다: 강성 메쉬 기반 얼굴 안정화, 통계적 및 프랙탈 분석을 이용한 동적 영역 선택, QR 분해 기반 RGB에서 PPG로의 변환(OMIT). 이 방법은 지도 학습 기반 방법이 아닌 비지도, 비학습 기반 rPPG 방법 중 최고 성능을 달성하며, 기준 데이터셋에서 평균 절대 오차(MAE)가 2.8 ± 3.0 bpm에 불과하여 일부 지도 학습 기반 딥 러닝 방법과 견줄 만큼 높은 정확도를 보이며, 계산 비용도 낮다(프레임당 17ms).

ABSTRACT

Photoplethysmography (PPG) signals have become a key technology in many fields, such as medicine, well-being, or sports. Our work proposes a set of pipelines to extract remote PPG signals (rPPG) from the face robustly, reliably, and configurable. We identify and evaluate the possible choices in the critical steps of unsupervised rPPG methodologies. We assess a state-of-the-art processing pipeline in six different datasets, incorporating important corrections in the methodology that ensure reproducible and fair comparisons. In addition, we extend the pipeline by proposing three novel ideas; 1) a new method to stabilize the detected face based on a rigid mesh normalization; 2) a new method to dynamically select the different regions in the face that provide the best raw signals, and 3) a new RGB to rPPG transformation method, called Orthogonal Matrix Image Transformation (OMIT) based on QR decomposition, that increases robustness against compression artifacts. We show that all three changes introduce noticeable improvements in retrieving rPPG signals from faces, obtaining state-of-the-art results compared with unsupervised, non-learning-based methodologies and, in some databases, very close to supervised, learning-based methods. We perform a comparative study to quantify the contribution of each proposed idea. In addition, we depict a series of observations that could help in future implementations.

연구 동기 및 목표

  • 비일관된 파이프라인 구성 및 신호 처리 선택으로 인한 비교 평가의 재현성과 공정성 부족 문제를 해결하기 위해.
  • 머리 움직임, 얼굴 표정, 조명 변화와 같은 실제 환경 조건에서도 rPPG 신호 추출의 강건성과 신뢰성을 향상시키기 위해.
  • 학습 데이터가 필요 없이도 지도 학습 기반 딥 러닝 방법과 비교할 만한 성능을 달성하는 순수하게 비지도, 비학습 기반 파이프라인을 개발하기 위해.
  • 신호 안정성 향상, 노이즈 억제, 아티팩트에 대한 내성 향상을 위한 새로운 구성 요소를 도입하기 위해.

제안 방법

  • 얼굴 랜드마크를 이용한 강성 메쉬 정규화 기법을 도입하여, 자세나 표정 변화에 관계없이 일관된 얼굴 영역에서 신호 추출을 안정화한다.
  • 통계적 및 프랙탈 분석을 활용해 신호 대 노이즈 비율이 가장 높은 얼굴 영역을 실시간으로 동적으로 식별하고 선택하여, 노이즈가 많거나 아티팩트에 취약한 영역은 제거한다.
  • QR 분해 기반의 새로운 RGB에서 PPG로의 변환 방법인 직교 행렬 이미지 변환(OMIT)을 제안하여, 영상 압축 아티팩트에 대한 강건성을 향상시킨다.
  • 일관된 얼굴 검출, 추적, 필터링 및 스펙트럼 분석을 보장함으로써 여섯 개의 데이터셋 간 평가 파이프라인을 표준화하여 공정하고 재현 가능한 비교를 가능하게 한다.
  • 다단계 신호 처리 파이프라인을 적용: 얼굴 검출 → 메쉬 정규화 → 피부 영역 분할 → 동적 ROI 선택 → 원시 신호 추출 → 필터링 → 스펙트럼 분석.
  • 최종 rPPG 신호로부터 심박수를 추정하기 위해 스펙트럼 분석(예: 주파수 도메인에서 피크 검출)을 활용하며, 추정치를 정밀화하기 위해 후처리를 수행한다.

실험 결과

연구 질문

  • RQ1얼굴 이동과 얼굴 표정 변화로 인한 영향을 어떻게 줄여야 하며, 시간이 지나도 같은 얼굴 영역에서 일관된 rPPG 신호 추출을 보장할 수 있는가?
  • RQ2실시간으로 rPPG 신호 추출에 가장 신뢰할 수 있는 얼굴 영역을 자동으로 식별하고 선택할 수 있는 기준은 무엇인가?
  • RQ3딥 러닝에 의존하지 않고도 RGB에서 PPG로의 변환 단계를 영상 압축 아티팩트에 더 강건하게 만들 수 있는가?
  • RQ4제안된 구성 요소들이 다양한 실제 환경 데이터셋에서 기존의 비지도, 비학습 기반 rPPG 방법에 비해 rPPG 성능을 얼마나 향상시키는가?
  • RQ5완전히 비지도 파이프라인이 학습 데이터가 필요 없이도 지도 학습 기반 딥 러닝 방법과 비교할 만한 성능을 달성할 수 있는가?

주요 결과

  • 제안된 강성 메쉬 정규화 기법은 자세나 움직임 변화에 관계없이 동일한 얼굴 영역을 추적함으로써 신호 일관성을 크게 향상시킨다.
  • 통계적 및 프랙탈 분석 기반의 동적 영역 선택은 노이즈와 아티팩트를 감소시켜 보다 신뢰할 수 있는 원시 신호 추출을 가능하게 한다.
  • QR 분해 기반의 OMIT 변환 방법은 전통적인 색상 기반 방법에 비해 영상 압축 아티팩트에 대해 뛰어난 강건성을 보였다.
  • Face2PPG는 UBFC-Motion 데이터셋에서 평균 절대 오차(MAE)가 2.8 ± 3.0 bpm로, 이전의 모든 비지도 비학습 기반 rPPG 방법을 능가한다.
  • Face2PPG는 비지도 rPPG 파이프라인 중 최고 성능을 기록했으며, MAHNOB 데이터셋에서 MAE 5.5 ± 5.0 bpm, UBFC-PPG에서 9.8 ± 4.6 bpm, PURE에서 12.5 ± 5.8 bpm를 기록하여 일부 지도 학습 기반 딥 러닝 모델의 성능에 가까워졌다.
  • 파이프라인이 프레임당 17ms(얼굴 검출 포함 시 33ms 이내)로 실행되어 딥 러닝 기반 rPPG 방법에 비해 뚜렷한 계산 성능 우수성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.