Skip to main content
QUICK REVIEW

[论文解读] BigSmall: Efficient Multi-Task Learning for Disparate Spatial and Temporal Physiological Measurements

Girish Narayanswamy, Yujia Liu|arXiv (Cornell University)|Mar 21, 2023
Optical Imaging and Spectroscopy TechniquesMedicine被引用 3
一句话总结

BigSmall 提出了一种统一且高效的多任务深度学习架构,可从视频中联合远程测量面部动作、心脏活动和呼吸。通过结合高分辨率的“Big”分支以捕捉空间细节,以及采用包裹时间移位模块(WTSM)的低分辨率‘Small’分支以捕捉时间动态,该模型在相比任务专用模型的情况下,实现了超过60%的计算效率提升,并达到最先进水平的准确率。

ABSTRACT

Understanding of human visual perception has historically inspired the design of computer vision architectures. As an example, perception occurs at different scales both spatially and temporally, suggesting that the extraction of salient visual information may be made more effective by paying attention to specific features at varying scales. Visual changes in the body due to physiological processes also occur at different scales and with modality-specific characteristic properties. Inspired by this, we present BigSmall, an efficient architecture for physiological and behavioral measurement. We present the first joint camera-based facial action, cardiac, and pulmonary measurement model. We propose a multi-branch network with wrapping temporal shift modules that yields both accuracy and efficiency gains. We observe that fusing low-level features leads to suboptimal performance, but that fusing high level features enables efficiency gains with negligible loss in accuracy. Experimental results demonstrate that BigSmall significantly reduces the computational costs. Furthermore, compared to existing task-specific models, BigSmall achieves comparable or better results on multiple physiological measurement tasks simultaneously with a unified model.

研究动机与目标

  • 开发一种统一的深度学习模型,仅使用视频输入即可联合预测不同生理信号——面部动作、心脏活动和呼吸。
  • 解决不同生理信号在空间和时间尺度上的差异性问题,该问题阻碍了高效多任务学习。
  • 在保持或提升准确率的同时,降低计算成本,相比任务优化模型更具优势。
  • 探索能够保留性能同时提升效率的特征融合策略。
  • 通过高效架构设计,实现多模态生理感知在实时、设备端部署。

提出的方法

  • 模型采用双分支架构:一个‘Big’分支使用高分辨率输入,以捕捉面部动作的精细空间特征;一个‘Small’分支使用低分辨率输入,以压缩空间噪声并突出时间动态。
  • 'Small'分支采用包裹时间移位模块(WTSM),以循环方式在帧之间移动时间特征,即使在帧数有限的情况下也能保留时间上下文,避免零填充特征的问题。
  • WTSM专为帧数较少的场景设计,因为在这些场景下,标准的零填充时间移位模块会因过多零值而降低性能。
  • 特征融合在高层表示层面进行,而非低层特征,实证表明该方法在计算开销极小的情况下可获得更好的准确率。
  • 模型在统一损失函数下进行端到端训练,该损失函数结合了面部动作单元(AUs)、光电容积脉搏波描记法(PPG)和呼吸的特定任务目标。
  • 采用混合空间与时间尺度以优化计算效率,与基线多任务模型相比,FLOPs减少超过60%。

实验结果

研究问题

  • RQ1单一深度学习模型能否有效且高效地从视频中预测具有不同空间与时间特征的多种生理信号?
  • RQ2与低层特征融合相比,高层特征融合是否能在多任务生理测量中实现更高的准确率与效率?
  • RQ3在远程生理感知中常见的低帧率场景下,包裹时间移位模块(WTSM)是否能优于标准时间移位模块?
  • RQ4与任务优化模型相比,统一模型在无需微调的情况下,对不同生理信号(面部动作、脉搏、呼吸)的泛化能力如何?
  • RQ5在多任务生理视频分析中,结合双分支设计与混合空间-时间尺度处理,能获得多大程度的计算效率提升?

主要发现

  • BigSmall 在三项任务——面部动作单元识别、脉搏率估计和呼吸率估计——上均达到最先进准确率,同时相比基线多任务模型,计算成本降低超过60%。
  • 在高层表示层面进行特征融合,相比低层融合,准确率损失可忽略不计,但能显著提升效率。
  • 在低帧率场景下,包裹时间移位模块(WTSM)优于标准零填充时间移位模块,后者因过多零值特征而性能下降。
  • 在某一模态上预训练并在其他模态上微调,性能表现欠佳,凸显了像BigSmall这样的统一多任务架构的必要性。
  • 该模型仅使用视频输入,无需额外传感器或模态专用架构,即可在多种生理信号间实现强大泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。