[논문 리뷰] Facial Video-based Remote Physiological Measurement via Self-supervised Learning
이 논문은 동기화된 얼굴 영상과 PPG 신호 데이터셋의 부족을 고려하여, 지도 학습이 필요 없는 자기지도 학습 프레임워크를 제안한다. 유연한 주파수 증강, 국소 rPPG 전문가 집합, 주파수 기반 손실 함수를 활용함으로써, 다섯 가지 벤치마크에서 심박수, HRV, 호흡 주파수 추정에서 최신 기술 수준(SOTA) 성능을 달성한다.
Facial video-based remote physiological measurement aims to estimate remote photoplethysmography (rPPG) signals from human face videos and then measure multiple vital signs (e.g. heart rate, respiration frequency) from rPPG signals. Recent approaches achieve it by training deep neural networks, which normally require abundant facial videos and synchronously recorded photoplethysmography (PPG) signals for supervision. However, the collection of these annotated corpora is not easy in practice. In this paper, we introduce a novel frequency-inspired self-supervised framework that learns to estimate rPPG signals from facial videos without the need of ground truth PPG signals. Given a video sample, we first augment it into multiple positive/negative samples which contain similar/dissimilar signal frequencies to the original one. Specifically, positive samples are generated using spatial augmentation. Negative samples are generated via a learnable frequency augmentation module, which performs non-linear signal frequency transformation on the input without excessively changing its visual appearance. Next, we introduce a local rPPG expert aggregation module to estimate rPPG signals from augmented samples. It encodes complementary pulsation information from different face regions and aggregate them into one rPPG prediction. Finally, we propose a series of frequency-inspired losses, i.e. frequency contrastive loss, frequency ratio consistency loss, and cross-video frequency agreement loss, for the optimization of estimated rPPG signals from multiple augmented video samples and across temporally neighboring video samples. We conduct rPPG-based heart rate, heart rate variability and respiration frequency estimation on four standard benchmarks. The experimental results demonstrate that our method improves the state of the art by a large margin.
연구 동기 및 목표
- rPPG 모델 학습을 위한 동기화된 얼굴 영상과 PPG 신호 데이터셋의 부족 문제를 해결하기 위해.
- 지상 진실 PPG 신호가 필요 없이, 쌍화되지 않은 얼굴 영상에서 자기지도 학습을 통해 rPPG 추정을 가능하게 하기 위해.
- 다양한 인종과 조명 조건에서의 일반화 능력과 강인성을 향상시키기 위해.
- 시간적 및 주파수적 변동에서 rPPG 신호 학습을 향상시키기 위한 주파수 인식 데이터 증강 및 손실 설계를 개발하기 위해.
제안 방법
- 비선형적으로 신호 주파수를 변환하면서도 시각적 외관을 유지하는 학습 가능한 주파수 증강(LFA) 모듈을 도입한다.
- 공간적 증강(예: 회전, 반전)을 적용하여 동일한 rPPG 주파수를 가진 양성 샘플을 생성한다.
- 지역별 박동 신호를 추출하고 영역-주의 및 시공간 게이팅을 통해 융합하는 국소 rPPG 전문가 집합(REA) 모듈을 활용한다.
- 세 가지 주파수 기반 손실 함수를 설계한다: 주파수 대비 손실, 주파수 비율 일致성 손실, 비디오 간 주파수 일致성 손실로 rPPG 추정을 최적화한다.
- 모든 쌍화된 PPG 애너테이션 없이, 단지 얼굴 영상 클립만을 사용하여 종단 간 자기지도 학습 방식으로 모델을 훈련시킨다.
- 이웃하는 영상 클립을 추가로 양성 샘플로 활용하여 주파수 일관성과 모델 강인성을 향상시킨다.
실험 결과
연구 질문
- RQ1지상 진실 PPG 신호가 필요 없이 자기지도 학습이 rPPG 모델을 효과적으로 학습시킬 수 있는가?
- RQ2고정 비율 리샘플링 대비 학습 가능한 주파수 증강이 대비 학습에서 모델 일반화 능력을 어떻게 향상시키는가?
- RQ3국소 rPPG 전문가 집합 모듈이 이질적인 얼굴 영역에서의 신호 추출을 얼마나 향상시키는가?
- RQ4주파수 기반 손실 함수가 다양한 주체와 영상 클립 간 rPPG 추정 정확도 및 일관성에 어떻게 기여하는가?
- RQ5특히 어두운 피부 톤에서의 저신호 대비 비율 조건에서, 다양한 인종 집단 간 모델 성능은 어떻게 변화하는가?
주요 결과
- 제안된 방법은 다섯 가지 표준 rPPG 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 이전의 지도 학습 및 자기지도 학습 방법들을 능가한다.
- BP4D+ 데이터셋에서 아시아계 주제에 대해 심박수 추정의 평균 절대 오차(MAE)는 2.54를 기록하였으며, Gideon 등 [20]에 비해 0.68 MAE 향상되었다.
- 아프리카계 주제에 대해서는 MAE 4.69를 기록하였으며, Gideon 등 [20]에 비해 0.46 향상되었지만, 어두운 피부 톤에서 픽셀 포화 현상으로 인해 성능이 여전히 낮게 유지되었다.
- 백인 주제에 대해서는 MAE 2.89를 기록하였으며, 이는 이전 SOTA에 비해 뚜렷한 성능 향상이다.
- 정성적 분석 결과, 특히 아시아계 및 백인 주제에서 신호의 주기성 향상과 심박 간격 변동 감소가 확인되었다.
- 균형 잡힌 인종 서브셋에 대한 실험 결과, 아프리카계 주제에서의 성능 저하 원인은 주로 어두운 피부 톤의 신호 캡처에 영향을 주는 카메라 감도 제한에 기인함을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.