Skip to main content
QUICK REVIEW

[논문 리뷰] Contrast-Phys+: Unsupervised and Weakly-supervised Video-based Remote Physiological Measurement via Spatiotemporal Contrast

Zhaodong Sun, Xiaobai Li|arXiv (Cornell University)|2023. 09. 13.
Non-Invasive Vital Sign Monitoring참고 문헌 80인용 수 5
한 줄 요약

Contrast-Phys+는 시공간 대비 학습을 활용하고 rPPG 전용 사전 지식—공간 유사성, 시간 일관성, 비디오 간 이질성, 심박수 범위 제약—를 통합한 새로운 비지도 및 약한 지도 학습 기반 영상 기반 원거리 광량측정법(rPPG) 방법이다. 지도 학습 기반 SOTA 방법보다도 정확도, 노이즈 내성, 계산 효율성 측면에서 뛰어난 성능을 기록하며, 지도 학습에 필요한 진짜 신호 레이블이 전혀 없거나, 레이블이 잘못 정렬되거나 누락된 경우에도 최신 기술 수준을 달성한다.

ABSTRACT

Video-based remote physiological measurement utilizes facial videos to measure the blood volume change signal, which is also called remote photoplethysmography (rPPG). Supervised methods for rPPG measurements have been shown to achieve good performance. However, the drawback of these methods is that they require facial videos with ground truth (GT) physiological signals, which are often costly and difficult to obtain. In this paper, we propose Contrast-Phys+, a method that can be trained in both unsupervised and weakly-supervised settings. We employ a 3DCNN model to generate multiple spatiotemporal rPPG signals and incorporate prior knowledge of rPPG into a contrastive loss function. We further incorporate the GT signals into contrastive learning to adapt to partial or misaligned labels. The contrastive loss encourages rPPG/GT signals from the same video to be grouped together, while pushing those from different videos apart. We evaluate our methods on five publicly available datasets that include both RGB and Near-infrared videos. Contrast-Phys+ outperforms the state-of-the-art supervised methods, even when using partially available or misaligned GT signals, or no labels at all. Additionally, we highlight the advantages of our methods in terms of computational efficiency, noise robustness, and generalization. Our code is available at https://github.com/zhaodongsun/contrast-phys.

연구 동기 및 목표

  • 지도 학습 기반 rPPG 학습을 위한 진짜 생리적 신호(GT) 확보의 높은 비용과 어려움을 해결하기 위해.
  • 비지도, 약한 지도 학습, 준지도 학습 환경 모두에서 효과적으로 작동하는 통합 프레임워크를 개발하기 위해.
  • 완전히 레이블링된 데이터가 필요 없이 노이즈, 머리 움직임, 레이블 정렬 오류에 대한 내성을 향상시키기 위해.
  • 실세계 rPPG 응용 분야에서 일반화 능력과 계산 효율성을 향상시키기 위해.

제안 방법

  • 얼굴 영상 클립에서 다중 시공간 rPPG 신호를 추출하기 위해 3D CNN을 사용한다.
  • 동일한 비디오에서 유사한 rPPG 신호를 군집하고, 다른 비디오의 신호는 상호 간리하게 만드는 대비 손실 함수를 설계한다.
  • 공간 유사성, 시간 일관성, 비디오 간 이질성, 심박수 범위(40–250bpm) 등의 rPPG 사전 지식을 대비 목표 함수에 통합한다.
  • 부분적 또는 잘못 정렬된 GT 신호를 대비 학습 과정에 통합하여 약한 지도 학습에 적응한다.
  • 기울기 기반 중요도 맵을 활용해 모델의 주의 집중 영역을 해석하고 얼굴 피부 부위에 집중하고 있음을 검증한다.
  • 데이터 증강 기반 대비 학습을 통해 엔드 투 엔드 학습을 수행하며, 자기 지도 학습과 레이블 효율성을 확보한다.
Figure 1: Illustration of rPPG spatial similarity. The rPPG signals from four facial areas (A, B, C, D) have similar waveforms and power spectrum densities (PSDs).
Figure 1: Illustration of rPPG spatial similarity. The rPPG signals from four facial areas (A, B, C, D) have similar waveforms and power spectrum densities (PSDs).

실험 결과

연구 질문

  • RQ1진짜 생리적 신호가 전혀 없는 상황에서 영상 데이터와 rPPG 사전 지식만을 활용해 rPPG를 정확하게 추정할 수 있는가?
  • RQ2부분적으로 레이블링되거나 잘못 정렬된 GT 신호로 학습했을 때, 완전히 레이블링된 지도 학습 기반 베이스라인과 비교해 모델 성능은 어떠한가?
  • RQ3rPPG 전용 사전 지식을 통합할 경우 노이즈 및 운동 아티팩트에 대한 내성은 어느 정도 향상되는가?
  • RQ4피팅 조정 없이도 새로운 데이터셋과 영상 조건에 대해 잘 일반화되는가?
  • RQ5대비 학습 목표 함수는 신호 품질 향상과 모델의 해석 가능성에 어떻게 기여하는가?

주요 결과

  • UBFC-rPPG 데이터셋에서 노이즈를 주입하지 않은 조건에서 Contrast-Phys+는 평균 절대 오차(MAE)가 0.64bpm을 기록하여 동일 조건에서 Gideon2021(1.85bpm)을 초월한다.
  • 비디오에 주기적 노이즈를 주입한 경우, Contrast-Phys+는 MAE가 0.74bpm을 유지하지만, Gideon2021는 22.47bpm으로 심각하게 성능 저하를 보이며, 뛰어난 노이즈 내성 능력을 입증한다.
  • 레이블이 0%일 경우에도 Contrast-Phys+는 GT 신호와 상관계수 0.991을 기록하며, 일부 설정에서는 완전히 레이블링된 지도 학습 방법을 뛰어넘는다.
  • 레이블 비율이 증가할수록 rPPG 파형이 점점 진짜 신호와 일치하며, 100% 레이블 조건에서는 거의 완벽한 피크 검출 성능을 보인다.
  • 중요도 맵 분석 결과, Contrast-Phys+는 일관되게 얼굴 피부 부위에 주의를 기울이는 반면, Gideon2021와 같은 베이스라인은 노이즈나 운동 아티팩트에 흩트려 있는 것으로 확인된다.
  • RGB 및 근적외선 영상 포함 5개의 공개 데이터셋에서 잘 일반화되며, 강력한 데이터셋 간 내성 성능을 보여준다.
Figure 2: Illustration of rPPG temporal similarity. The rPPG signals from two temporal windows (A, B) have similar PSDs.
Figure 2: Illustration of rPPG temporal similarity. The rPPG signals from two temporal windows (A, B) have similar PSDs.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.