[논문 리뷰] DeepPhys: Video-Based Physiological Measurement Using Convolutional Attention Networks
DeepPhys는 RGB 및 적외선 비디오에서 피부 반사 기반 모션 표현과 외관 가이드 어텐션을 이용하여 머리의 움직임 및 조명 변화에 견고하게 대처하는 엔드 투 엔드 합성곱 주의 네트워크를 통해 비접촉식 심박수(HR) 및 호흡수(BR) 추정합니다.
Non-contact video-based physiological measurement has many applications in health care and human-computer interaction. Practical applications require measurements to be accurate even in the presence of large head rotations. We propose the first end-to-end system for video-based measurement of heart and breathing rate using a deep convolutional network. The system features a new motion representation based on a skin reflection model and a new attention mechanism using appearance information to guide motion estimation, both of which enable robust measurement under heterogeneous lighting and major motions. Our approach significantly outperforms all current state-of-the-art methods on both RGB and infrared video datasets. Furthermore, it allows spatial-temporal distributions of physiological signals to be visualized via the attention mechanism.
연구 동기 및 목표
- 비디오에서 심박수(HR)와 호흡수(BR)를 회복하기 위한 엔드투엔드 딥러닝 시스템을 개발한다.
- 이질적 조명에 적합한 피부 반사 모델 기반의 새로운 모션 표현을 제안한다.
- 움직임 및 조명 변화 속에서 생리 신호를 견고하게 추정하기 위한 외관 guided 어텐션 메커니즘을 도입한다.
- 어텐션 맵의 시공간 분포를 시각화할 수 있도록 한다.”],
- method_unchanged_note_reserved_end
- method:[
제안 방법
- 피부 반사 모델에서 파생된 정규화된 프레임 차이 모션 표현을 도입하여 생리적 움직임을 포착한다.
- 프레임을 다운샘플링하고 시간 도함수 정규화를 적용하여 정지 성분 및 카메라/휘도 변화를 제거한다.
- MSE 손실로 모션 표현을 생리 신호의 도함수 p'(t)로 매핑하기 위해 VGG 스타일의 CNN을 학습시키고, 이후 대역통과 필터링 및 우세 주파수 추출을 통해 HR/BR를 얻는다.
- 피부 영역에서 더 강한 신호를 집중시켜 모션 추정기를 안내하는 소프트 어텐션 마스크를 학습하기 위해 1x1 컨볼루션 커널과 시그모이드 기반 정규화를 사용하는 외관 모델을 도입한다(여러 층에 적용 가능).
- HR/BR 추정에서 가장 작은 주파수 오차를 가진 모델을 선택하기 위해 학습 체크포인트 간의 앙상블 선택을 사용한다.
- 다양한 헤드 모션 및 조명 조건에서 RGB 및 적외선 데이터셋의 여러 최신 방법들과 비교 평가한다.
실험 결과
연구 질문
- RQ1다양한 조명 아래 피부 반사에서 도출된 모션 표현으로부터 직접 robust한 HR 및 BR 신호를 학습하는 엔드투엔드 CNN이 가능한가?
- RQ2외관 guided 어텐션이 모션 추정 및 생리 신호 복구를 모션-전용 모델보다 개선시키는가?
- RQ3제안된 방법이 서로 다른 디바이스, 조명, 머리 움직임이 있는 데이터세트 및 시나리오에서 얼마나 잘 일반화되는가?
- RQ4머리 움직임이 HR/BR 추정에 미치는 영향은 무엇이며, 모델이 큰 움직임에서도 성능을 유지할 수 있는가?
주요 결과
- CAN(convolutional attention network)은 HR 및 BR 추정 모두에 대해 머리 움직임이 큰 경우를 포함한 여러 RGB 및 적외선 데이터셋에서 최첨단 방법을 능가한다.
- 피부 반사 모델링이 결합된 정규화된 프레임 차이 모션 표현은 이질적 조명 하에서도 견고한 생리 신호 회복을 가능하게 한다.
- 외관 guided 어텐션 메커니즘은 ROI 로컬라이제이션을 개선하고 모션-전용 모델에 비해 측정 정확도를 높인다.
- 어텐션 시각화는 비디오 프레임에서 생리 신호의 시공간 분포를 드러낸다(예: HR 관련 영역).
- 참가자 의존적 결과에서 CAN은 향상된 MAE 및 SNR를 보이며, 특히 고모션 작업에서 우수한 성능을 보이고; 참가자 독립적 결과도 CAN의 이점을 보여주나 일반적으로 전체 참가자 의존형 설정보다 절대 성능이 낮다.
- 학습 체크포인트 간 앙상블 선정을 통해 HR/BR 추정의 주파수 영역 오차를 추가로 감소시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.