[논문 리뷰] PhysFormer: Facial Video-based Physiological Measurement with Temporal Difference Transformer
이 논문은 원격 광량측정법(rPPG)을 위한 엔드 투 엔드 비디오 트랜스포머 아키텍처인 PhysFormer을 제안한다. 이는 장거리 시공간적 맥락에서 준주기적 rPPG 특징을 향상시키기 위해 시간 차이 지도(global attention)를 활용한다. ImageNet 사전학습 없이도 여러 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성하며, 내부 및 교차 데이터셋 평가에서 강력한 일반화 및 강인성을 입증한다.
Remote photoplethysmography (rPPG), which aims at measuring heart activities and physiological signals from facial video without any contact, has great potential in many applications (e.g., remote healthcare and affective computing). Recent deep learning approaches focus on mining subtle rPPG clues using convolutional neural networks with limited spatio-temporal receptive fields, which neglect the long-range spatio-temporal perception and interaction for rPPG modeling. In this paper, we propose the PhysFormer, an end-to-end video transformer based architecture, to adaptively aggregate both local and global spatio-temporal features for rPPG representation enhancement. As key modules in PhysFormer, the temporal difference transformers first enhance the quasi-periodic rPPG features with temporal difference guided global attention, and then refine the local spatio-temporal representation against interference. Furthermore, we also propose the label distribution learning and a curriculum learning inspired dynamic constraint in frequency domain, which provide elaborate supervisions for PhysFormer and alleviate overfitting. Comprehensive experiments are performed on four benchmark datasets to show our superior performance on both intra- and cross-dataset testings. One highlight is that, unlike most transformer networks needed pretraining from large-scale datasets, the proposed PhysFormer can be easily trained from scratch on rPPG datasets, which makes it promising as a novel transformer baseline for the rPPG community. The codes will be released at https://github.com/ZitongYu/PhysFormer.
연구 동기 및 목표
- 기존 rPPG 방법이 국소 수용장치에 의존하고 장거리 시공간적 종속성을 모델링하지 못하는 한계를 해결하기 위해.
- 얼굴 영상에서 글로벌 맥락적 신호를 캡처할 수 있는 엔드 투 엔드 딥 러닝 프레임워크를 개발하기 위해.
- 저감독 상황에서 과적합을 완화하고 내재된 rPPG 인식 특징을 향상시키는 감독 전략을 설계하기 위해.
- 대규모 사전학습에 의존하지 않고도 효과적으로 학습을 시작할 수 있도록 하여 트랜스포머 시대의 rPPG 신규 기준을 설정하기 위해.
제안 방법
- 세밀한 시간적 피부 색상 차이를 활용해 장거리 시공간적 관계를 모델링하는 계층적 시간 차이 트랜스포머(TD-Transformer) 백본을 도입한다.
- 유사한 신호 추세를 여러 프레임과 영역 간에 주의를 기울여 준주기적 rPPG 신호를 향상시키기 위해 시간 차이 다중헤드 자기주도 주의(TD-MHSA)를 활용한다.
- 생리적 신호 레이블의 불확실성을 모델링하기 위해 레이블 분포 학습을 적용하여 노이즈가 많은 레이블에 대한 강인성을 향상시킨다.
- 과정 학습 기반의 동적 손실을 주파수 도메인에 통합하여 학습을 이끌고 과적합을 줄이며, 지수적으로 증가하는 가중치를 적용한다.
- 관찰된 프레임 간의 시공간 영역을 테이블 기반 토큰화로 표현하여 효율적인 비디오 시퀀스 모델링을 가능하게 한다.
- ImageNet 또는 기타 대규모 사전학습에 의존하지 않고 rPPG 데이터셋에서 엔드 투 엔드로 모델을 학습시킨다.
실험 결과
연구 질문
- RQ1비디오 트랜스포머 아키텍처는 얼굴 영상에서 rPPG 측정을 위한 장거리 시공간적 종속성을 효과적으로 모델링할 수 있는가?
- RQ2시간 차이 지도 글로벌 주의는 국소 컨볼루션 또는 표준 자기주도 주의에 비해 rPPG 특징 추출을 어떻게 향상시키는가?
- RQ3동적 주파수 도메인 감독은 저감독 rPPG 학습에서 모델의 일반화 능력 향상과 과적합 감소에 어떻게 기여하는가?
- RQ4ImageNet-21K와 같은 대규모 데이터셋에서 사전학습 없이도 PhysFormer이 최신 기술 수준의 성능을 달성할 수 있는가?
- RQ5헤드 수와 깊이와 같은 아키텍처 하이퍼파라미터는 모델의 성능 및 강인성에 어떤 영향을 미치는가?
주요 결과
- PhysFormer은 ImageNet 사전학습 없이도 VIPL-HR, rPPG용 데이터셋 등 네 가지 벤치마크 데이터셋에서 우수하거나 최신 기술 수준의 성능을 달성한다.
- 지수적으로 증가하는 β를 적용한 동적 주파수 도메인 감독을 사용한 모델은 고정 또는 선형 증가 전략보다 더 빠르게 수렴하고 더 낮은 RMSE를 기록한다.
- 시간 차이 모듈에서 θ = 0.4 또는 0.7일 때 최적의 성능을 달성하여, 주의 기능에 대한 정규화된 국소 시간 기울기의 중요성을 입증한다.
- 네 개의 주의 헤드를 사용할 경우 최고의 성능를 기록하며, 헤드 수가 적을 경우 성능 저하가 심각하게 발생함을 확인하여, rPPG 패tern의 다중헤드 모델링의 필요성을 강조한다.
- 더 깊은 네트워크는 더 많은 TD-Transformer 블록을 통해 점차 RMSE를 감소시키지만, 계산 비용이 증가한다.
- 주의 시각화 결과, 모델이 생리학적으로 관련된 영역(예: 이마, 볼)을 주의하고 주기적인 rPPG 신호 추세와 일치함을 확인했지만, 일부 노이즈가 있거나 단계가 이동된 반응이 남아 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.