[论文解读] Multi-Task Temporal Shift Attention Networks for On-Device Contactless Vitals Measurement
论文提出 MTTS-CAN,一种基于设备端的视频方法,使用时间移位注意力来实时共同估计心率和呼吸,达到在 ARM CPU 上的高 FPS 与最先进的准确性。
Telehealth and remote health monitoring have become increasingly important during the SARS-CoV-2 pandemic and it is widely expected that this will have a lasting impact on healthcare practices. These tools can help reduce the risk of exposing patients and medical staff to infection, make healthcare services more accessible, and allow providers to see more patients. However, objective measurement of vital signs is challenging without direct contact with a patient. We present a video-based and on-device optical cardiopulmonary vital sign measurement approach. It leverages a novel multi-task temporal shift convolutional attention network (MTTS-CAN) and enables real-time cardiovascular and respiratory measurements on mobile platforms. We evaluate our system on an Advanced RISC Machine (ARM) CPU and achieve state-of-the-art accuracy while running at over 150 frames per second which enables real-time applications. Systematic experimentation on large benchmark datasets reveals that our approach leads to substantial (20%-50%) reductions in error and generalizes well across datasets.
研究动机与目标
- 为远程医疗和远程监测提供非接触式生命体征测量的动机,降低感染风险并实现可及的护理。
- 开发一个在设备端、实时的模型,能够共同估计心血管和呼吸信号。
- 解决基于相机的生命体征感知中的隐私、便携性和精度约束。
- 在公开数据集和 ARM 硬件上展示最先进的准确性与高推理速度。
提出的方法
- 提出 MTTS-CAN,一种用于设备端生命体征测量的多任务时间移位卷积注意力网络。
- 引入时间移位模块以在不使用 3D 卷积的情况下建模时间动态,并引入一个注意力机制以聚焦信号承载区域。
- 使用多任务损失函数联合估计血容量脉搏(BVP)和呼吸信号。
- 将架构与 2D-CAN、3D-CAN、Hybrid-CAN 基线进行比较,并在基于 ARM 的 Firefly-RK3399 平台上使用 TVM 评估设备端延迟。
- 基于 Shafer 的二色反射模型对光学建模,以将 RGB 视频与 BVP 和呼吸信号相关联。
- 通过外观分支和运动分支对输入进行预处理,包括用于外观的帧平均和基于帧差的运动特征。
实验结果
研究问题
- RQ1基于时间移位且在设备端的网络是否能够从面部视频中准确估计脉搏和呼吸信号?
- RQ2将注意力机制整合到时间移位框架中是否能在噪声(运动、光照)条件下提升信号提取?
- RQ3脉搏和呼吸之间对中间表示的多任务共享如何影响准确性和效率?
- RQ4在 ARM 硬件上不同架构变体下,MTTS-CAN 的设备端延迟和内存需求是多少?
- RQ5所提出的模型在不同分辨率、背景和光照条件的数据集上的泛化能力如何?
主要发现
- MTTS-CAN 在 AFRL 和 MMSE-HR 数据集上实现脉搏测量和呼吸估计的最先进准确性。
- TS-CAN 变体相比基线实现更快的推理(每帧最低 6-12 ms),实现实时性能。
- 多任务 TS-CAN(MTTS-CAN)在保持与单任务模型相对准确性的同时,计算和内存大约降低了 50%。
- 时序模型(MTTS-CAN、TS-CAN、Hybrid-CAN、3D-CAN)在头部运动较大时尤其优于 2D-CAN 和其他基线。
- 跨数据集评估显示相对于 2D-CAN,误差降低 25-50%,其中 MTTS-CAN 和 MT-Hybrid-CAN 展现出强泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。