Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Task Temporal Shift Attention Networks for On-Device Contactless Vitals Measurement

Xin Liu, Josh Fromm|arXiv (Cornell University)|2020. 06. 06.
Non-Invasive Vital Sign Monitoring참고 문헌 38인용 수 150
한 줄 요약

논문은 MTTS-CAN을 도입한다. 실시간으로 심박수와 호흡을 공동 추정하는 온-디바이스 비디오 기반 방법으로, ARM CPU에서 높은 FPS로 최첨단 정확도를 달성한다.

ABSTRACT

Telehealth and remote health monitoring have become increasingly important during the SARS-CoV-2 pandemic and it is widely expected that this will have a lasting impact on healthcare practices. These tools can help reduce the risk of exposing patients and medical staff to infection, make healthcare services more accessible, and allow providers to see more patients. However, objective measurement of vital signs is challenging without direct contact with a patient. We present a video-based and on-device optical cardiopulmonary vital sign measurement approach. It leverages a novel multi-task temporal shift convolutional attention network (MTTS-CAN) and enables real-time cardiovascular and respiratory measurements on mobile platforms. We evaluate our system on an Advanced RISC Machine (ARM) CPU and achieve state-of-the-art accuracy while running at over 150 frames per second which enables real-time applications. Systematic experimentation on large benchmark datasets reveals that our approach leads to substantial (20%-50%) reductions in error and generalizes well across datasets.

연구 동기 및 목표

  • 원격의료 및 원격 모니터링을 위한 비접촉 활력징후 측정의 필요성과 접근 가능한 치료 제공의 동기를 제시한다.
  • 카디오혈관 및 호흡 신호를 실시간으로 공동 추정하는 온-device 모델을 개발한다.
  • 카메라 기반 활력 sensing의 프라이버시, 휴대성 및 정밀도 제약을 다룬다.
  • 공개 데이터셋과 ARM 하드웨어에서 최첨단 정확도와 높은 추론 속도를 시연한다.

제안 방법

  • 온-디바이스 활력 측정용 다중 작업 템포럴 시프트 컨볼루셔널 어텐션 네트워크인 MTTS-CAN을 제안한다.
  • 3D 합성곱 없이 템포럴 다이나믹스를 모델링하기 위한 템포럴 시프트 모듈을 도입하고, 신호를 담고 있는 영역에 집중하는 어텐션 메커니즘을 도입한다.
  • 혈류부피 펄스(BVP)와 호흡 신호를 함께 추정하기 위한 다중 작업 손실을 사용한다.
  • 아키텍처를 2D-CAN, 3D-CAN, Hybrid-CAN 베이스라인과 ARM 기반 Firefly-RK3399 플랫폼의 TVM을 이용한 온-디바이스 지연 시간에서 평가한다.
  • _RGB 비디오를 BVP 및 호흡 신호와 연관시키는 샤퍼의 이색 반사 모델(Dichromatic Reflection Model)로 광학 모델링을 ground한다.
  • appearance 및 motion 가지치를 포함한 입력 전처리, appearance용 프레임 평균화 및 motion 특징으로 프레임 차이 기반 특징을 사용한다.

실험 결과

연구 질문

  • RQ1템포럴 시프트 기반의 온-디바이스 네트워크가 얼굴 영상에서 맥박 및 호흡 신호를 정확히 추정할 수 있는가?
  • RQ2시간 시프트 프레임워크에 어텐션을 통합하면 노이즈(움직임, 조도) 조건에서 신호 추출이 향상되는가?
  • RQ3맥박과 호흡 사이의 중간 표현 공유가 정확도와 효율성에 어떤 영향을 미치는가?
  • RQ4다양한 아키텍처 변형에서 MTTS-CAN의 ARM 하드웨어 상의 온-디바이스 지연 시간과 메모리 요구사항은 무엇인가?
  • RQ5다른 해상도, 배경, 조명 조건의 데이터셋 간 제시된 모델이 얼마나 잘 일반화되는가?

주요 결과

  • MTTS-CAN은 AFRL 및 MMSE-HR 데이터셋에서 맥박 측정 및 호흡 추정에 대해 최첨단 정확도를 제공한다.
  • TS-CAN 변형은 베이스라인보다 더 빠른 추론 속도(프레임당 6-12 ms까지 가능)로 실시간 성능을 가능하게 한다.
  • 다중 작업 TS-CAN(MTTS-CAN)은 단일 작업 모델에 비해 계산 및 메모리를 약 50% 감소시키면서 정확도를 유지한다.
  • 시계열 모델들(MTTS-CAN, TS-CAN, Hybrid-CAN, 3D-CAN)은 2D-CAN 및 다른 베이스라인보다 뛰어나며, 특히 더 높은 머리 움직임에서 우수하다.
  • 크로스-데이터셋 평가에서 2D-CAN 대비 25-50%의 오차 감소를 보였고, MTTS-CAN 및 MT-Hybrid-CAN이 강한 일반화를 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.