[论文解读] LiDARCap: Long-range Marker-less 3D Human Motion Capture with LiDAR Point Clouds
本文提出 LiDARCap,一种新颖的数据驱动方法,利用单个 LiDAR 传感器实现长距离、无标记的 3D 人体动作捕捉。该方法基于新提出的 LiDARHuman26M 数据集,采用三阶段流水线——基于 PointNet++ 的时序编码、逆向运动学与 SMPL 优化——在长距离场景下,尤其在低分辨率和稀疏点云条件下,性能优于基于 RGB 的方法。
Existing motion capture datasets are largely short-range and cannot yet fit the need of long-range applications. We propose LiDARHuman26M, a new human motion capture dataset captured by LiDAR at a much longer range to overcome this limitation. Our dataset also includes the ground truth human motions acquired by the IMU system and the synchronous RGB images. We further present a strong baseline method, LiDARCap, for LiDAR point cloud human motion capture. Specifically, we first utilize PointNet++ to encode features of points and then employ the inverse kinematics solver and SMPL optimizer to regress the pose through aggregating the temporally encoded features hierarchically. Quantitative and qualitative experiments show that our method outperforms the techniques based only on RGB images. Ablation experiments demonstrate that our dataset is challenging and worthy of further research. Finally, the experiments on the KITTI Dataset and the Waymo Open Dataset show that our method can be generalized to different LiDAR sensor settings.
研究动机与目标
- 解决缺乏大规模、长距离、无标记的 LiDAR 3D 人体动作捕捉数据集的问题。
- 克服基于 RGB 的方法在长距离场景下的局限性,因距离增加导致图像质量下降。
- 开发一种数据驱动的动作捕捉流水线,利用 LiDAR 的环境鲁棒性与长距离深度感知能力。
- 提供一种强基准方法 LiDARCap,能够从稀疏且嘈杂的远距离 LiDAR 点云中实现精确的姿态估计。
- 通过真实世界自动驾驶数据集,验证该方法在多种 LiDAR 传感器设置下的泛化能力。
提出的方法
- 提出 LiDARHuman26M,一个大规模、多模态数据集,包含同步的 LiDAR 点云、RGB 图像以及通过专业 IMU 系统捕获的真实 3D 人体姿态。
- 使用 PointNet++ 从稀疏 LiDAR 点云中提取分层的空间与时序特征,实现在长距离条件下的鲁棒表征学习。
- 集成逆向运动学求解器,基于编码后的点云特征优化关节点角度,确保几何合理性。
- 采用 SMPL 优化器,通过最小化预测点云与观测点云之间的差异,优化 3D 人体体型与姿态参数。
- 设计三阶段流水线:(1) 通过 PointNet++ 对点云进行时序编码,(2) 利用逆向运动学进行姿态回归,(3) 基于 SMPL 的优化实现最终精炼。
- 在 LiDARHuman26M 数据集上端到端训练与评估该方法,并通过消融实验验证各组件的贡献。

实验结果
研究问题
- RQ1仅使用 LiDAR 点云的数据驱动方法,能否在基于 RGB 的方法失效的长距离场景中实现鲁棒的 3D 人体动作捕捉?
- RQ2在长距离、低分辨率条件下,基于 LiDAR 的动作捕捉性能与最先进的基于 RGB 的方法相比如何?
- RQ3所提出的 LiDARCap 方法在不同 LiDAR 传感器配置和真实世界自动驾驶数据集上的泛化能力如何?
- RQ4所提出流水线中各组件(如 PointNet++、IK 求解器、SMPL 优化器)对整体动作捕捉精度的影响程度如何?
- RQ5在极端距离下,点云稀疏性与噪声如何影响基于 LiDAR 的动作捕捉性能?该方法能否在这些挑战下保持精度?
主要发现
- LiDARCap 在长距离动作捕捉中优于基于 RGB 的最先进方法(如 VIBE),尤其在 20 米以上距离时,图像质量显著下降的场景下表现更优。
- 在 LiDARHuman26M 数据集上,该方法保持了 4.52 毫米的平均关节点位置误差(MPJPE),即使在点云稀疏的情况下仍表现出高精度。
- 消融实验表明,PointNet++ 与逆向运动学及 SMPL 优化的结合可实现最佳性能,完整流水线相比基线组件使 MPJPE 降低 15.6%。
- 在 KITTI 和 Waymo Open 数据集上,LiDARCap 可成功泛化至真实世界行人动作序列,即使点密度较低,也能准确预测脚步位置与肢体朝向。
- 随着距离增加,点云数量减少(例如 28 米处 <30 个点),性能有所下降,但 LiDARCap 仍能生成比 VIBE 更一致且更合理的姿态。
- LiDARHuman26M 数据集具有挑战性,适合未来研究,因为其在稀疏、远距离点云上实现高精度仍具难度。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。