[논문 리뷰] PhysFormer++: Facial Video-based Physiological Measurement with SlowFast Temporal Difference Transformer
이 논문은 얼굴 영상에서 비접촉 생리 측정을 위한 엔드 투 엔드 비디오 트랜스포머 아키텍처인 PhysFormer과 PhysFormer++을 제안한다. 시간 차이 트랜스포머와 글로벌 어텐션, 그리고 슬로우패스트 이중경로 설계를 활용하여 주기적인 rPPG 신호를 강화하고 운동, 조명, 영상 품질 열화에 대한 강건성을 향상시켜, 사전 훈련 없이도 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성한다.
Remote photoplethysmography (rPPG), which aims at measuring heart activities and physiological signals from facial video without any contact, has great potential in many applications (e.g., remote healthcare and affective computing). Recent deep learning approaches focus on mining subtle rPPG clues using convolutional neural networks with limited spatio-temporal receptive fields, which neglect the long-range spatio-temporal perception and interaction for rPPG modeling. In this paper, we propose two end-to-end video transformer based architectures, namely PhysFormer and PhysFormer++, to adaptively aggregate both local and global spatio-temporal features for rPPG representation enhancement. As key modules in PhysFormer, the temporal difference transformers first enhance the quasi-periodic rPPG features with temporal difference guided global attention, and then refine the local spatio-temporal representation against interference. To better exploit the temporal contextual and periodic rPPG clues, we also extend the PhysFormer to the two-pathway SlowFast based PhysFormer++ with temporal difference periodic and cross-attention transformers. Furthermore, we propose the label distribution learning and a curriculum learning inspired dynamic constraint in frequency domain, which provide elaborate supervisions for PhysFormer and PhysFormer++ and alleviate overfitting. Comprehensive experiments are performed on four benchmark datasets to show our superior performance on both intra- and cross-dataset testings. Unlike most transformer networks needed pretraining from large-scale datasets, the proposed PhysFormer family can be easily trained from scratch on rPPG datasets, which makes it promising as a novel transformer baseline for the rPPG community.
연구 동기 및 목표
- CNN 기반 rPPG 모델이 얼굴 영상 내 장거리 시공간적 상관관계와 주기적 동역학을 포착하는 데 한계가 있음을 해결하기 위해.
- 시간 차이 유도 글로벌 어텐션을 활용해 준주기적 rPPG 특징을 향상시키는 트랜스포머 기반 아키텍처를 개발하기 위해.
- 실제 rPPG 모니터링 환경에서 머리 움직임, 영상 압축, 저해상도 입력에 대한 강건성을 향상시키기 위해.
- 대규모 사전 훈련 없이도 효과적인 훈련을 가능하게 하여 트랜스포머 시대의 rPPG에 새로운 기준을 설정하기 위해.
- 학습 안정성 향상과 과적합 감소를 위해 새로운 감독 메커니즘—라벨 분포 학습과 주파수 도메인 커리큘럼 학습—을 도입하기 위해.
제안 방법
- 핵심 아키텍처는 시간 차이 표현을 사용해 국소적 및 글로벌 시공간적 특징에 대해 어텐션을 계산하는 시간 차이 트랜스포머를 사용한다.
- 이 방법은 프레임 간 상대적 강도 변화에 초점을 맞춰 주기적인 rPPG 신호를 강화하는 새로운 시간 차이 다중헤드 자기어텐션(TD-MHPSA) 모듈을 도입한다.
- PhysFormer++는 '슬로우' 스트림이 장거리 맥락을 캡처하고 '패스트' 스트림이 단기 동역학을 모델링하는 슬로우패스트 이중경로 설계를 통해 모델을 확장하여 더 나은 특징 융합을 가능하게 한다.
- 모델은 교차어텐션과 주기적 어텐션 메커니즘을 활용해 rPPG 신호 내 반복 패턴에 초점을 맞춰 표현을 정밀하게 다듬는다.
- 주파수 도메인 커리큘럼 손실이 적용되어 모델이 점진적으로 주기적 패턴을 학습하도록 제약을 두어 일반화 능력을 향상시킨다.
- 라벨 분포 학습을 통해 소프트 타겟으로 모델을 감독하여 강건성 향상과 과적합 감소를 달성한다.
실험 결과
연구 질문
- RQ1비디오 트랜스포머 아키텍처가 rPPG 측정을 위해 얼굴 영상 내 장거리 시공간적 상관관계를 효과적으로 모델링할 수 있는가?
- RQ2시간 차이 특징을 통합함으로써 엔드 투 엔드 학습에서 준주기적 rPPG 신호의 모델링이 어떻게 향상되는가?
- RQ3슬로우패스트 설계가 rPPG 추정에서 머리 움직임과 영상 열화에 대한 강건성을 얼마나 향상시키는가?
- RQ4제안된 방법이 대규모 데이터셋 사전 훈련 없이도 최신 기술 수준의 성능을 달성할 수 있는가?
- RQ5제안된 감독 메커니즘—라벨 분포 학습과 주파수 도메인 커리큘럼 학습—이 모델 일반화 능력을 향상시키는 데 얼마나 효과적인가?
주요 결과
- 100%의 데이터로 훈련했을 때 VIPL-HR 데이터셋에서 PhysFormer++는 RMSE 7.62 bpm을 기록하여 AutoHR(8.68 bpm)와 PhysFormer(7.79 bpm)를 모두 능가한다.
- OBF 데이터셋에서 고압축 영상(1000 kb/s) 조건에서도 PhysFormer++는 rPPGNet을 능가하는 성능을 유지하며, 특히 500 kb/s에서 두드러진 성능을 보였다.
- 저해상도 조건(16×16)에서도 PhysFormer++는 RMSE 9.58 bpm을 기록하여 영상 품질 열화와 장거리 모니터링 환경에서도 강건함을 입증했다.
- 훈련 데이터의 10%만으로도 PhysFormer++는 RMSE 13.92 bpm을 달성하여, 동일한 저데이터 환경에서 데이터 집약적인 CNN 기반 모델인 AutoHR(15.77 bpm)와 경쟁 가능한 성능을 보였다.
- 제안된 어텐션 손실($\mathcal{L}_{\text{atten}}$)은 더 주기적이고 규칙적인 어텐션 맵을 유도하여 운동 오염 조건에서 모델 안정성과 성능을 향상시켰다.
- 제거 실험 결과, 시간 차이 어텐션과 슬로우패스트 설계 모두 성능 향상에 기여하며, 특히 교차 데이터셋 및 과도한 실제 환경 설정에서 두드러진 효과를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.