Skip to main content
QUICK REVIEW

[论文解读] Multi-View Multi-Person 3D Pose Estimation with Plane Sweep Stereo

Jiahao Lin, Gim Hee Lee|arXiv (Cornell University)|Apr 6, 2021
Human Pose and Action Recognition参考文献 23被引用 4
一句话总结

本文提出一种基于平面扫面立体视觉的方法,用于多视角多人3D姿态估计,直接回归关节点深度,无需显式跨视角对应匹配。通过利用平面扫面实现视角间的几何一致性,并采用自粗到精的深度回归方案,该方法在保持SOTA精度的同时,推理速度相比先前基于学习的方法(如VoxelPose)快达20倍。

ABSTRACT

Existing approaches for multi-view multi-person 3D pose estimation explicitly establish cross-view correspondences to group 2D pose detections from multiple camera views and solve for the 3D pose estimation for each person. Establishing cross-view correspondences is challenging in multi-person scenes, and incorrect correspondences will lead to sub-optimal performance for the multi-stage pipeline. In this work, we present our multi-view 3D pose estimation approach based on plane sweep stereo to jointly address the cross-view fusion and 3D pose reconstruction in a single shot. Specifically, we propose to perform depth regression for each joint of each 2D pose in a target camera view. Cross-view consistency constraints are implicitly enforced by multiple reference camera views via the plane sweep algorithm to facilitate accurate depth regression. We adopt a coarse-to-fine scheme to first regress the person-level depth followed by a per-person joint-level relative depth estimation. 3D poses are obtained from a simple back-projection given the estimated depths. We evaluate our approach on benchmark datasets where it outperforms previous state-of-the-arts while being remarkably efficient. Our code is available at https://github.com/jiahaoLjh/PlaneSweepPose.

研究动机与目标

  • 为解决多视角多人3D姿态估计中跨视角对应匹配的挑战,该挑战在多阶段流水线中易引入误差并降低性能。
  • 通过几何一致性联合融合多视角信息,而非显式匹配,实现端到端、单次推理的3D姿态估计。
  • 相比VoxelPose等3D体素方法,显著提升计算效率,后者在稀疏场景中需承担高昂的3D卷积计算开销。
  • 无需事先知晓3D场景体积或相机布局信息,即可在不同相机配置下实现良好泛化。
  • 通过自粗到精的方案,利用隐式多视角一致性,实现每个2D姿态关节点的高精度深度回归。

提出的方法

  • 该方法在目标视角中使用平面扫面立体视觉对每个2D姿态关节点进行深度回归,其中虚拟深度平面被反投影并映射到参考视角。
  • 在每个深度层级上,通过比较跨视角映射后的特征来衡量跨视角一致性,从而指导深度回归网络。
  • 采用两阶段自粗到精的深度估计:首先估计人体级别的深度,然后在狭窄范围内估计关节点级别的相对深度。
  • 利用深度预测结果将2D姿态反投影至3D空间,形成3D姿态,并通过基于距离的聚类在多视角间进行融合。
  • 框架对每个2D姿态使用1D卷积,而非在整个体素空间上使用3D卷积,显著降低计算量。
  • 整个流水线端到端训练,无需显式2D姿态匹配或三角测量。

实验结果

研究问题

  • RQ1平面扫面立体视觉能否有效适配于多视角多人3D姿态估计中,实现关节点级别的深度回归?
  • RQ2自粗到精的深度估计方案是否能在保持计算效率的同时提升精度?
  • RQ3通过平面扫面实现的隐式多视角一致性,是否在复杂场景中优于显式的跨视角对应匹配?
  • RQ4该方法在未预先知晓3D场景布局的情况下,能否在不同相机配置中实现良好泛化?
  • RQ5该方法能否在显著低于3D体素方法推理成本的前提下,实现SOTA性能?

主要发现

  • 在Campus数据集上,该方法达到97.0%的平均精度,相比之前SOTA的96.7%有所提升。
  • 在Shelf数据集上,该方法达到97.9%的平均精度,高于此前方法的97.4%。
  • 在CMU Panoptic数据集上,该方法将MPJPE降低至16.75mm,相比VoxelPose的17.68mm提升了0.93mm。
  • 该方法推理速度相比VoxelPose最高提升20倍,帧率适合实时应用。
  • 即使仅使用两台相机,该方法仍保持超过92%的精度,展现出在低可见性环境下的鲁棒性。
  • 该方法在不同相机配置间具有良好的泛化能力,无论在随机相机集上训练或在固定相机集上测试,性能均表现相当。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。