Skip to main content
QUICK REVIEW

[论文解读] View Invariant Human Body Detection and Pose Estimation from Multiple Depth Sensors

Walid Bekhtaoui, Ruhan Sa|arXiv (Cornell University)|May 8, 2020
Human Pose and Action Recognition参考文献 31被引用 6
一句话总结

该论文提出Point R-CNN,一种端到端的多视角3D人体姿态估计网络,通过在输入层融合多个深度传感器的点云,提升了在复杂室内环境中对鲁棒性的要求。通过在处理前拼接点云,该方法在性能上优于级联模型,并在摄像头故障、视角变化和杂乱场景下表现出良好的泛化能力,在CMU Panoptic和MVOR数据集上优于当前最先进基线方法。

ABSTRACT

Point cloud based methods have produced promising results in areas such as 3D object detection in autonomous driving. However, most of the recent point cloud work focuses on single depth sensor data, whereas less work has been done on indoor monitoring applications, such as operation room monitoring in hospitals or indoor surveillance. In these scenarios multiple cameras are often used to tackle occlusion problems. We propose an end-to-end multi-person 3D pose estimation network, Point R-CNN, using multiple point cloud sources. We conduct extensive experiments to simulate challenging real world cases, such as individual camera failures, various target appearances, and complex cluttered scenes with the CMU panoptic dataset and the MVOR operation room dataset. Unlike most of the previous methods that attempt to use multiple sensor information by building complex fusion models, which often lead to poor generalization, we take advantage of the efficiency of concatenating point clouds to fuse the information at the input level. In the meantime, we show our end-to-end network greatly outperforms cascaded state-of-the-art models.

研究动机与目标

  • 解决在手术室和监控系统等多摄像头室内环境中,视图不变的人体检测与3D姿态估计挑战。
  • 通过提出一种更简单、高效的输入层融合策略(基于点云),克服复杂多传感器融合模型泛化能力差的问题。
  • 开发一种端到端深度学习框架,联合执行多人群3D目标检测与关键点回归,提升准确率与鲁棒性。
  • 在真实故障场景下评估方法性能,包括摄像头中断、视角变化和杂乱背景,使用真实世界数据集。

提出的方法

  • 该方法在输入层通过拼接多个深度传感器的点云,再输入3D卷积神经网络,避免了复杂的后期或特征级融合。
  • Point R-CNN是一种端到端架构,通过体素化点云输入,联合执行3D人体检测与3D关键点回归。
  • 网络在体素化点云上使用区域提议网络(RPN)生成3D目标提议,随后对分割出的人体点进行关键点回归。
  • 该模型在CMU Panoptic和MVOR数据集上进行训练与微调,并通过数据增强模拟摄像头故障与视角变化。
  • 该方法采用PointNet风格操作处理点云,并引入空间变换以提升特征学习能力,无需预处理。
  • 评估使用标准指标:以厘米为单位的平均关节点位置误差(MPJPE)以及10厘米阈值内的准确率。

实验结果

研究问题

  • RQ1在多人3D姿态估计中,输入层融合多传感器点云是否优于复杂的后期融合或特征级融合模型?
  • RQ2所提出的端到端网络在真实世界挑战(如摄像头故障与视角变化)下的泛化能力如何?
  • RQ3在具有复杂背景的杂乱室内场景(如手术室)中,该方法是否能保持高精度?
  • RQ4与级联模型相比,该端到端架构在检测与关键点回归性能方面表现如何?

主要发现

  • 在CMU Panoptic数据集上,Point R-CNN实现了10.24厘米的平均关节点距离与10厘米阈值内59.4%的准确率,优于基线方法[1]+[16](13.80厘米,33.1%)。
  • 在视角与人物泛化测试中,该方法实现了9.33厘米的平均距离与10厘米阈值内65.64%的准确率,优于基线方法(10.90厘米,53.6%)。
  • 在具有挑战性的MVOR数据集(杂乱场景)上,Point R-CNN实现了17.70厘米的平均距离与10厘米阈值内26.1%的准确率,显著优于基线方法(24.96厘米,15.4%)。
  • 端到端的Point R-CNN模型在CMU Panoptic数据集上实现了90.54%的AP(平均精度),优于级联基线方法的80.65%。
  • 图7的定性结果表明,该方法在多样化场景中均能保持一致且准确的姿态估计,红色(预测)与绿色(真实)骨骼高度对齐。
  • 该方法在摄像头故障模拟下表现出鲁棒性,即使高达50%的摄像头被随机禁用,仍能保持高性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。