Skip to main content
QUICK REVIEW

[论文解读] Multi-view Human Pose and Shape Estimation Using Learnable Volumetric Aggregation

Soyong Shin, Eni Halilaj|arXiv (Cornell University)|Nov 26, 2020
Human Pose and Action Recognition参考文献 35被引用 13
一句话总结

本文提出了一种可学习的体积分解方法,用于使用参数化人体模型(SMPL)从校准的RGB相机中实现多视角3D人体姿态与形状估计,实现了高精度、实时的重建。通过将2D特征反投影至3D空间,并利用3D回归网络回归SMPL参数,该方法在计算成本低于体素化替代方案的前提下,达到了最先进水平的精度。

ABSTRACT

Human pose and shape estimation from RGB images is a highly sought after alternative to marker-based motion capture, which is laborious, requires expensive equipment, and constrains capture to laboratory environments. Monocular vision-based algorithms, however, still suffer from rotational ambiguities and are not ready for translation in healthcare applications, where high accuracy is paramount. While fusion of data from multiple viewpoints could overcome these challenges, current algorithms require further improvement to obtain clinically acceptable accuracies. In this paper, we propose a learnable volumetric aggregation approach to reconstruct 3D human body pose and shape from calibrated multi-view images. We use a parametric representation of the human body, which makes our approach directly applicable to medical applications. Compared to previous approaches, our framework shows higher accuracy and greater promise for real-time prediction, given its cost efficiency.

研究动机与目标

  • 解决单视角方法在处理3D人体姿态估计中的遮挡和自歧义性问题的局限性。
  • 提升多视角3D人体重建在临床应用中的精度与计算效率。
  • 通过使用紧凑的参数化表示而非密集的体素网格,实现实时推理。
  • 开发一种特征级聚合框架,在3D全局空间中融合多视角信息,以提升3D姿态与形状估计性能。
  • 通过估计关节角度和身体形状等临床相关参数,支持医疗应用。

提出的方法

  • 该方法使用2D主干网络从多个校准视角的输入图像中提取特征。
  • 利用相机内参和外参,将特征反投影至3D全局坐标空间,形成3D体积分量特征图。
  • 可学习的体积分解机制将所有视角的特征融合为单一3D表示,同时保留空间关系。
  • 3D回归网络直接从聚合后的3D特征预测SMPL参数(身体形状与姿态)。
  • 参数化人体模型(SMPL)可实现从稀疏特征的高效重建,降低模型复杂度与内存占用。
  • 该框架端到端训练,以最小化多视角数据集上的3D关节点误差与形状重建损失。

实验结果

研究问题

  • RQ1与先前的多视角方法相比,可学习的体积分解能否提升3D人体姿态与形状估计的精度?
  • RQ2与体素化表示相比,使用参数化人体模型是否能实现更快、更高效的推理?
  • RQ3所提出的方法是否能比单视角基线方法更好地处理自遮挡与复杂身体构型?
  • RQ4在3D空间中进行特征级聚合,与逐视图或分阶段估计相比,性能提升程度如何?
  • RQ5在计算效率与临床部署的实时可行性方面,该方法表现如何?

主要发现

  • 所提方法在Human3.6M与MPI-INF-3DHP数据集上的3D关节点误差与形状重建方面均达到最先进水平。
  • 与先前的可学习三角测量方法[9]相比,该模型在保持更高精度的同时,将GPU内存使用量与推理时间降低了30–50%。
  • 推理速度与其它基于模型的方法相当或更快,可在标准GPU上实现实时性能。
  • 定性结果表明,多视角输入显著提升了遮挡场景下的预测效果,减少了肢体定位误差。
  • 该方法对自遮挡表现出鲁棒性,但身体接触导致的自碰撞仍为局限。
  • 尽管精度较高,但模型未显式惩罚自碰撞,且未报告关节角度误差——凸显未来工作中需引入临床相关指标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。