Skip to main content
QUICK REVIEW

[论文解读] A Multi-view RGB-D Approach for Human Pose Estimation in Operating Rooms

Abdolrahim Kadkhodamohammadi, Afshin Gangi|arXiv (Cornell University)|Jan 25, 2017
Human Pose and Action Recognition参考文献 37被引用 4
一句话总结

本文提出一种多视角RGB-D方法,用于手术室中的3D人体姿态估计,通过卷积神经网络(ConvNets)进行部件检测,并利用3D成对约束以实现运动学一致性。通过融合三台同步相机的深度数据,并使用随机森林过滤虚假检测,该方法在多人、遮挡及视觉杂乱的手术室环境中,相较于最先进方法显著提升了精度。

ABSTRACT

Many approaches have been proposed for human pose estimation in single and multi-view RGB images. However, some environments, such as the operating room, are still very challenging for state-of-the-art RGB methods. In this paper, we propose an approach for multi-view 3D human pose estimation from RGB-D images and demonstrate the benefits of using the additional depth channel for pose refinement beyond its use for the generation of improved features. The proposed method permits the joint detection and estimation of the poses without knowing a priori the number of persons present in the scene. We evaluate this approach on a novel multi-view RGB-D dataset acquired during live surgeries and annotated with ground truth 3D poses.

研究动机与目标

  • 解决由于表面视觉相似性和无纹理手术衣导致标准RGB方法失效的手术室中3D人体姿态估计挑战。
  • 开发一种系统,可在不预先知晓人数的情况下检测并估计多名医护人员的3D姿态。
  • 不仅利用深度数据提升特征表示,还利用其进行鲁棒的3D点反投影和多视角对应匹配,克服基于外观的匹配失败问题。
  • 通过联合优化3D部件位置,结合置信度图、深度重投影代价和多视角一致性,提升定位精度。

提出的方法

  • 在RGB-D数据上训练基于卷积神经网络(ConvNet)的部件检测器,以在每个视角中检测身体部件,通过大感受野引入上下文信息。
  • 采用3D成对形变模型,直接在3D空间中施加身体部件之间的运动学约束,提升拥挤场景中关节的一致性。
  • 在场景特定特征上训练随机森林,学习关于手术室的先验知识,以每视角过滤虚假骨架候选。
  • 利用深度图将检测结果反投影至3D空间,实现在仅单视角可见点的情况下仍能建立3D对应关系。
  • 提出一种新颖的能量函数,通过四步迭代优化,联合结合检测置信度、深度重投影代价和多视角证据,优化跨视角的3D部件位置。
  • 优化过程采用从粗到精的搜索策略,步长依次为50 cm、10 cm、2 cm和1 cm,以高效探索3D空间。

实验结果

研究问题

  • RQ1深度数据是否能在提升外观特征之外,进一步改善手术室中的3D人体姿态估计?
  • RQ2如何利用多视角RGB-D数据在不预先知晓人数的情况下,可靠地检测和估计多人姿态?
  • RQ3在遮挡和杂乱的手术室环境中,施加3D运动学约束在多大程度上能提升姿态估计性能?
  • RQ4基于深度的重投影代价在跨多视角引导3D姿态优化方面有多高效?

主要发现

  • 所提方法在使用标签投票时,将仅有一个或两个可见视角的骨架的3D部件定位误差减少最多达10 cm,而三视角可见的骨架误差减少约3 cm,表明检测可靠性显著提升。
  • 多视角优化即使在仅单视角检测到骨架的情况下也能降低定位误差,证明了基于深度的重投影代价和置信度融合的有效性。
  • 若排除基于深度的重投影代价项,性能出现显著下降,凸显其在精确3D姿态精炼中的关键作用。
  • 经过多视角融合后,该方法实现了高精度的3D骨架检测,随机森林先验显著提升了检测质量,有效过滤了虚假候选。
  • 在优化函数中引入3D成对约束,使身体构型更加一致且准确,尤其在多人和遮挡场景中表现突出。
  • 该方法是首个无需预先知晓场景中人数的多视角RGB-D 3D人体姿态估计方法,可联合完成检测与姿态估计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。