[论文解读] DeepMultiCap: Performance Capture of Multiple Characters Using Sparse Multiview Cameras
DeepMultiCap 提出了一种新颖的方法,仅通过稀疏多视角 RGB 视频即可实现高保真度、多人的运动捕捉,且无需预先扫描的模板。通过结合空间注意力感知模块、基于 SMPL 的 3D 先验以及时间融合策略,该方法在严重遮挡和时间不一致性条件下实现了最先进水平的重建性能,其有效性已在新构建的高质量数据集 MultiHuman 上得到验证。
We propose DeepMultiCap, a novel method for multi-person performance capture using sparse multi-view cameras. Our method can capture time varying surface details without the need of using pre-scanned template models. To tackle with the serious occlusion challenge for close interacting scenes, we combine a recently proposed pixel-aligned implicit function with parametric model for robust reconstruction of the invisible surface areas. An effective attention-aware module is designed to obtain the fine-grained geometry details from multi-view images, where high-fidelity results can be generated. In addition to the spatial attention method, for video inputs, we further propose a novel temporal fusion method to alleviate the noise and temporal inconsistencies for moving character reconstruction. For quantitative evaluation, we contribute a high quality multi-person dataset, MultiHuman, which consists of 150 static scenes with different levels of occlusions and ground truth 3D human models. Experimental results demonstrate the state-of-the-art performance of our method and the well generalization to real multiview video data, which outperforms the prior works by a large margin.
研究动机与目标
- 实现仅从稀疏多视角 RGB 视频中进行高保真度、多人 3D 运动捕捉,且无需预先扫描的模板。
- 通过将隐式函数与参数化 SMPL 模型结合作为 3D 几何代理,缓解紧密互动场景中的严重遮挡问题。
- 通过设计一种空间注意力感知模块,提升多视角特征融合中的细粒度几何细节恢复能力。
- 通过一种新颖的基于 SDF 的时间融合方法,提升动态序列中的时间一致性。
- 提供一个全新的高质量基准数据集 MultiHuman,用于评估多人运动捕捉系统。
提出的方法
- 设计了一种空间注意力感知模块,以自适应方式聚合多视角特征,突出不同视角中高频几何细节。
- 该方法将 SMPL 作为 3D 先验,用于重建被遮挡区域的完整人体,同时利用全局法线图引导注意力机制,提升鲁棒性。
- 提出一种新颖的时间融合策略,对视频帧之间的符号距离场(SDF)进行加权,以降低噪声并提升动态重建的时间一致性。
- 框架采用像素对齐的隐式函数表示 3D 几何结构,从而实现从多视角图像中高效且精细的表面重建。
- 系统基于一个新构建的数据集 MultiHuman 进行训练与评估,该数据集包含 150 个高质量、多人互动场景,具有不同的遮挡水平。
实验结果
研究问题
- RQ1基于深度学习的方法能否在无需预扫描模板的前提下,从稀疏多视角 RGB 视频中实现对多人互动场景的高保真 3D 重建?
- RQ2如何通过 3D 先验与注意力机制缓解多人运动捕捉中的严重遮挡问题?
- RQ3空间注意力模块在多视角 3D 重建中能在多大程度上提升细粒度几何细节的恢复能力?
- RQ4时间融合策略在降低动态 3D 序列中的噪声与时间不一致性方面有多有效?
- RQ5一个全新的、高质量的多人遮挡场景数据集能否作为评估运动捕捉系统性能的可靠基准?
主要发现
- DeepMultiCap 在多人运动捕捉任务中实现了最先进性能,在合成数据与真实世界数据上均显著超越了先前方法。
- 空间注意力感知模块显著提升了重建质量,尤其在涉及高频细节(如法线图)时表现突出。
- 将 SMPL 作为 3D 代理的整合,使得被遮挡身体部位的重建更加鲁棒,消融实验表明,若移除 SMPL 先验,精度会明显下降。
- 时间融合方法有效减少了时间伪影,提升了动态序列的一致性,这一效果在定性对比与补充视频中得到验证。
- 由 150 个高质量、多人互动、遮挡水平各异的场景组成的 MultiHuman 数据集,为多人运动捕捉系统的详细且可靠的评估提供了支持。
- 该方法在真实世界多视角视频数据上展现出强大的泛化能力,即使在极具挑战性的遮挡条件下,也能生成高保真结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。