Skip to main content
QUICK REVIEW

[논문 리뷰] Contrast-Phys: Unsupervised Video-based Remote Physiological Measurement via Spatiotemporal Contrast

Zhaodong Sun, Xiaobai Li|arXiv (Cornell University)|2022. 08. 08.
Non-Invasive Vital Sign Monitoring참고 문헌 57인용 수 4
한 줄 요약

이 논문은 얼굴 영상에서 심박수와 같은 생리신호를 지도 학습이 필요 없는 지표 없이 추정하기 위해 시공간 대비 학습을 활용하는 비지도 영상 기반 원격 광량측정법(비지도 rPPG)인 Contrast-Phys를 제안한다. 동일한 영상 내에서 공간적·시간적 위치 간의 rPPG 신호 유사성과 다른 영상 간의 이질성을 고려함으로써, 최신 지도 학습 기반 rPPG 모델과 유사한 성능을 달성하면서도 훨씬 더 빠르고 노이즈에 더 강건한 성능을 보인다.

ABSTRACT

Video-based remote physiological measurement utilizes face videos to measure the blood volume change signal, which is also called remote photoplethysmography (rPPG). Supervised methods for rPPG measurements achieve state-of-the-art performance. However, supervised rPPG methods require face videos and ground truth physiological signals for model training. In this paper, we propose an unsupervised rPPG measurement method that does not require ground truth signals for training. We use a 3DCNN model to generate multiple rPPG signals from each video in different spatiotemporal locations and train the model with a contrastive loss where rPPG signals from the same video are pulled together while those from different videos are pushed away. We test on five public datasets, including RGB videos and NIR videos. The results show that our method outperforms the previous unsupervised baseline and achieves accuracies very close to the current best supervised rPPG methods on all five datasets. Furthermore, we also demonstrate that our approach can run at a much faster speed and is more robust to noises than the previous unsupervised baseline. Our code is available at https://github.com/zhaodongsun/contrast-phys.

연구 동기 및 목표

  • 학습 중에 비용이 많이 드는 진정한 생리신호 지표가 필요 없도록 비지도 rPPG 방법을 개발하는 것.
  • 기존 비지도 rPPG 방법의 성능을 떨어뜨리는 주기적 노이즈와 머리 움직임에 대한 강건성을 향상시키는 것.
  • 생리신호 지표 없이 영상 데이터만을 사용하여 지도 학습 기반 rPPG 모델과 유사한 성능을 달성하는 것.
  • 이전 자기지도 학습 접근법에서 사용하는 중복된 모델 순방향 전파를 피하여 학습 효율성을 향상시키는 것.

제안 방법

  • 이 방법은 단일 영상에서 공간(높이, 너비) 및 시간(시간) 차원을 통해 다수의 rPPG 신호를 추출하는 시공간 rPPG(ST-rPPG) 블록 표현을 도입한다.
  • 3D 컨볼루션 신경망(3D CNN) 기반 모델을 사용하여 영상 클립을 처리하고 ST-rPPG 특징을 생성함으로써 rPPG 신호의 공간적·시간적 통합 모델링을 가능하게 한다.
  • 동일한 영상의 rPPG 신호를 서로 가까이 모으고(양성 쌍), 다른 영상의 신호를 서로 멀리 떼는(음성 쌍) 대비 손실을 적용하여 대비 학습을 수행한다.
  • 네 가지 핵심 rPPG 관측 결과를 활용한다: 얼굴 부위 간의 공간적 유사성, 짧은 클립 내 시간적 유사성, 다른 영상 간의 이질성, 그리고 제한된 심박수 범위(0.66–4.16 Hz).
  • 시공간 샘플링을 통해 동일한 영상 내 다른 공간적·시간적 위치에서 양성 쌍을 생성하고, 다른 영상 간에서 음성 쌍을 형성한다.
  • 지표 없이도 종단간 최적화가 가능한 대비 손실을 사용하여 학습 목표를 최적화한다.

실험 결과

연구 질문

  • RQ1지표 생리신호가 전혀 없는 얼굴 영상에서 rPPG 신호를 정확하게 추정할 수 있는가?
  • RQ2시공간 대비 학습이 rPPG 내재적 규칙성을 효과적으로 활용하여 비지도 표현 학습을 가능하게 할 수 있는가?
  • RQ3기존 비지도 rPPG 기반 방법과 비교해 본다면, 제안된 방법은 정확도, 속도, 노이즈 강건성 측면에서 어떤가?
  • RQ4ST-rPPG 블록 구축에 최적의 시공간 해상도와 클립 길이는 무엇인가?

주요 결과

  • Contrast-Phys는 이전 비지도 기반 기준 [Gideon2021]보다 공개된 다섯 개의 데이터셋 전반에서 성능을 뛰어넘었으며, UBFC-rPPG 데이터셋에서 평균 절대 오차(MAE)가 0.64 bpm을 기록하여 이전 방법의 1.85 bpm보다 훨씬 낮았다.
  • UBFC-rPPG 데이터셋에서 Contrast-Phys는 R값 0.995를 기록하여 최고의 지도 학습 기반 rPPG 방법과 거의 동일한 성능을 달성했다.
  • 주기적 노이즈를 주입했을 경우, Contrast-Phys는 MAE 0.74 bpm, R 0.991을 유지했지만, Gideon2021는 MAE 22.47 bpm, R 0.244로 성능이 급격히 악화되었다.
  • 이전 비지도 접근법에서 중복된 순방향 전파를 피하기 때문에, 이 방법은 훨씬 더 빠른 속도로 실행된다.
  • 민감도 분석 결과, 2×2 공간 해상도와 10초 시간 길이가 수신장과 신호 품질의 균형을 고려할 때 최적의 성능을 내는 것으로 나타났다.
  • 활성도 맵 분석 결과, 노이즈나 머리 움직임이 있더라도 Contrast-Phys는 얼굴 피부 부위를 정확히 집중하는 것으로 확인되었고, 반면 Gideon2021는 비정상적이고 노이즈에 민감한 주의 패턴을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.