[论文解读] 4D Human Body Capture from Egocentric Video via 3D Scene Grounding
本文提出一种基于优化的方法,利用单目第一视角视频中的2D姿态观测和结构光场(SfM)重建的3D场景上下文,实现对第二人称人体网格的4D重建。该方法解决了3D人体与场景模型之间的尺度模糊性问题,即使在部分遮挡情况下,也能实现准确、时序一致且符合物理规律的人体-场景交互,且在新提出的EgoMoCap数据集上,其姿态准确性和交互真实性优于当前最先进方法。
We introduce a novel task of reconstructing a time series of second-person 3D human body meshes from monocular egocentric videos. The unique viewpoint and rapid embodied camera motion of egocentric videos raise additional technical barriers for human body capture. To address those challenges, we propose a simple yet effective optimization-based approach that leverages 2D observations of the entire video sequence and human-scene interaction constraint to estimate second-person human poses, shapes, and global motion that are grounded on the 3D environment captured from the egocentric view. We conduct detailed ablation studies to validate our design choice. Moreover, we compare our method with the previous state-of-the-art method on human motion capture from monocular video, and show that our method estimates more accurate human-body poses and shapes under the challenging egocentric setting. In addition, we demonstrate that our approach produces more realistic human-scene interaction.
研究动机与目标
- 解决从单目第一视角视频中重建4D第二人称人体网格的挑战,其中相机运动和部分可见性阻碍了传统方法的应用。
- 通过整合来自SfM的2D姿态观测和3D场景上下文,实现时序一致且基于场景定位的3D人体重建。
- 解决单目第一视角设置下3D人体与场景重建之间的尺度模糊性问题,而此前方法未能解决该问题。
- 在具有挑战性的第一视角条件下,展示改进的人体姿态与形状估计准确性及真实性,特别是在部分遮挡期间。
- 引入EgoMoCap数据集,该数据集是一个结构化的第一视角视频基准,包含多样的人际距离和2D关键点标注,适用于第二人称动作捕捉。
提出的方法
- 该方法在时间维度上构建联合优化,整合整个视频序列的2D关键点观测和通过SfM重建的3D场景几何信息。
- 通过施加人体-场景接触约束,确保重建的3D人体与3D场景之间具有物理上合理的交互。
- 优化过程同时估计3D人体模型与SfM重建场景之间的相对尺度,从而克服单目SfM固有的尺度模糊性。
- 引入时序先验(零加速度)以稳定全局运动估计,尤其在身体部位间歇性可见时。
- 该方法采用SMPL-X作为3D人体模型,并通过可微渲染和投影损失,优化姿态、形状和全局运动参数。
- 利用整个视频序列提升鲁棒性,避免因帧间独立估计在部分可见时失效的问题。
实验结果
研究问题
- RQ1单目SfM提供的3D场景上下文是否能提升在部分可见条件下的第一视角视频中第二人称4D人体重建性能?
- RQ2在单目第一视角设置下,如何解决3D人体与场景重建之间的尺度模糊性问题?
- RQ3结合2D观测与3D场景几何信息进行时间维度上的联合优化,是否能产生比帧间独立方法更时序一致且更真实的人体运动?
- RQ4在具有挑战性第一视角条件下,该方法与SOTA方法如VIBE相比,在姿态准确性和人体-场景交互真实性方面表现如何?
- RQ5在第二人称仅部分可观测时,3D场景定位的使用在多大程度上提升了全局运动估计的性能?
主要发现
- 所提方法在EgoMoCap数据集上取得66.03的PJE-P得分,显著优于VIBE的75.91,证明其在部分观测条件下的优越性能。
- 该方法将运动平滑性误差降低至1.85,远低于VIBE的4.79,表明其具有更连贯、更真实全局运动估计能力。
- 用户研究结果显示,82.8%的受试者更偏好本方法而非基线方法,证实其在人体-场景交互真实性方面有显著提升。
- 该方法成功解决了3D人体与场景之间的相对尺度问题,消除了SMPLify-X基线结果中观察到的尺度不匹配现象。
- 消融实验验证了使用3D场景上下文和时序优化的有效性,尤其在处理部分可见性方面表现突出。
- 与VIBE相比,本方法生成的人体-场景交互更具合理性,后者因未建模接触关系且受第一视角相机运动影响,导致运动不一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。