Skip to main content
QUICK REVIEW

[论文解读] Simultaneously-Collected Multimodal Lying Pose Dataset: Towards In-Bed Human Pose Monitoring under Adverse Vision Conditions

Shuangjun Liu, Xiaofei Huang|arXiv (Cornell University)|Aug 20, 2020
Human Pose and Action Recognition参考文献 55被引用 16
一句话总结

本论文介绍了同步采集的多模态说谎姿势(SLP)数据集,这是一个大规模、公开可用的床铺人体姿态数据集,涵盖RGB、长波红外、深度图和压力图等多种模态。该数据集支持在完全黑暗或遮挡等不利条件下,使用最先进模型实现高达95%的PCKh@0.5准确率,实现鲁棒的2D姿态估计,并支持多模态融合以提升性能。

ABSTRACT

Computer vision (CV) has achieved great success in interpreting semantic meanings from images, yet CV algorithms can be brittle for tasks with adverse vision conditions and the ones suffering from data/label pair limitation. One of this tasks is in-bed human pose estimation, which has significant values in many healthcare applications. In-bed pose monitoring in natural settings could involve complete darkness or full occlusion. Furthermore, the lack of publicly available in-bed pose datasets hinders the use of many successful pose estimation algorithms for this task. In this paper, we introduce our Simultaneously-collected multimodal Lying Pose (SLP) dataset, which includes in-bed pose images from 109 participants captured using multiple imaging modalities including RGB, long wave infrared, depth, and pressure map. We also present a physical hyper parameter tuning strategy for ground truth pose label generation under extreme conditions such as lights off and being fully covered by a sheet/blanket. SLP design is compatible with the mainstream human pose datasets, therefore, the state-of-the-art 2D pose estimation models can be trained effectively with SLP data with promising performance as high as 95% at PCKh@0.5 on a single modality. The pose estimation performance can be further improved by including additional modalities through collaboration.

研究动机与目标

  • 解决计算机视觉和医疗应用中缺乏公开可用、大规模的床铺人体姿态数据集的问题。
  • 在完全黑暗或被被褥完全遮挡等不利视觉条件下,实现准确的人体姿态估计。
  • 提出一种物理超参数调优(PHPT)策略,在极端成像条件下生成可靠的真值姿态标签。
  • 构建一个与主流姿态估计基准兼容的多模态数据集,以促进最先进模型的训练与评估。
  • 为未来在床铺行为监测领域的多模态融合、域适应和迁移学习研究提供基础。

提出的方法

  • 使用四种模态(RGB、长波红外(LWIR)、深度(D)和压力图(PM))同步采集109名参与者的床铺姿态数据。
  • 采用物理超参数调优(PHPT)方法,在受试者完全覆盖或完全黑暗的情况下,仍能生成准确的真值姿态标签。
  • 设计SLP数据集时,确保其与标准人体姿态估计基准(如COCO、MPII)兼容,以支持现有2D姿态模型的直接训练与评估。
  • 开发一种新颖的LWIR-D-PM可视化工具,融合多种模态,为临床提供直观的患者体位与身体状态洞察。
  • 在SLP数据上评估最先进2D与3D姿态估计模型在不同模态、覆盖条件及环境(家庭与医院)下的表现。
  • 进行消融研究,评估多模态融合带来的性能提升,并分析3D姿态估计在床铺条件下可能出现的失败模式。

实验结果

研究问题

  • RQ1能否在视觉条件恶劣的情况下,创建一个涵盖RGB、LWIR、深度图和压力图模态的同步采集、大规模多模态床铺姿态数据集?
  • RQ2当在SLP数据集上训练时,现有最先进2D人体姿态估计模型在完全黑暗或遮挡等极端条件下表现如何?
  • RQ3与单模态基线相比,多模态融合在多大程度上提升了床铺姿态估计的准确性?
  • RQ4基于RGB或深度图的预训练3D姿态估计模型能否泛化到床铺姿态?其主要失败模式是什么?
  • RQ5床铺场景中的姿态分布与标准人体姿态数据集中的分布有何不同?这对模型泛化能力有何影响?

主要发现

  • SLP数据集包含来自109名参与者的超过15,000张标注的床铺姿态图像,数据在不同光照和遮挡条件下,通过四种成像模态采集。
  • 在SLP数据集上,使用单模态训练的最先进2D姿态估计模型最高可达到95%的PCKh@0.5准确率,表明其在不利视觉条件下仍具有强大性能。
  • 物理超参数调优(PHPT)策略能够在完全黑暗或被被褥完全覆盖等极端条件下,实现可靠的真值姿态标签生成。
  • 多模态融合一致提升了姿态估计性能,尤其在融合LWIR、深度图和压力图数据时,性能提升显著。
  • 基于RGB或深度图的预训练3D姿态估计模型在床铺姿态上泛化能力较差,常将静止姿势误判为站立姿势,或因身体表面融合与背景混淆导致肢体定位错误。
  • SLP数据集与现有姿态数据集(如COCO和MPII)具有互补性,因为床铺姿态表现出典型日常活动数据集中所不具备的独特光照、遮挡和姿态分布特征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。