Skip to main content
QUICK REVIEW

[论文解读] Monocular Real-Time Volumetric Performance Capture

Ruilong Li, Yuliang Xiu|arXiv (Cornell University)|Jul 28, 2020
Advanced Vision and Imaging参考文献 84被引用 4
一句话总结

该论文提出首个实时单目体素化性能捕捉系统,仅通过单个视频流即可重建高保真、完整纹理的3D人体,无需多视角设置或个性化模板。通过引入分层表面定位算法与无网格渲染,该方法将重建速度提升两个数量级,在256³分辨率下实现15 fps的性能,同时结合在线难例挖掘技术,显著提升了对罕见姿态与复杂衣着样式的鲁棒性。

ABSTRACT

We present the first approach to volumetric performance capture and novel-view rendering at real-time speed from monocular video, eliminating the need for expensive multi-view systems or cumbersome pre-acquisition of a personalized template model. Our system reconstructs a fully textured 3D human from each frame by leveraging Pixel-Aligned Implicit Function (PIFu). While PIFu achieves high-resolution reconstruction in a memory-efficient manner, its computationally expensive inference prevents us from deploying such a system for real-time applications. To this end, we propose a novel hierarchical surface localization algorithm and a direct rendering method without explicitly extracting surface meshes. By culling unnecessary regions for evaluation in a coarse-to-fine manner, we successfully accelerate the reconstruction by two orders of magnitude from the baseline without compromising the quality. Furthermore, we introduce an Online Hard Example Mining (OHEM) technique that effectively suppresses failure modes due to the rare occurrence of challenging examples. We adaptively update the sampling probability of the training data based on the current reconstruction accuracy, which effectively alleviates reconstruction artifacts. Our experiments and evaluations demonstrate the robustness of our system to various challenging angles, illuminations, poses, and clothing styles. We also show that our approach compares favorably with the state-of-the-art monocular performance capture. Our proposed approach removes the need for multi-view studio settings and enables a consumer-accessible solution for volumetric capture.

研究动机与目标

  • 实现仅通过单个消费级摄像头即可实时、高质量地进行体素化性能捕捉,无需多视角系统或预先捕获的模板。
  • 克服传统PIFu隐式重建方法在实时部署中计算开销过大的瓶颈,该方法每帧通常需要数十秒时间。
  • 通过解决训练数据中的类别不平衡问题,提升对罕见姿态、复杂衣着与光照变化等挑战性条件的重建鲁棒性。
  • 实现无需显式提取网格的直接高效新视角渲染,降低渲染延迟。

提出的方法

  • 提出一种分层表面定位算法,以粗到精的方式查询3D点,大幅减少表面重建所需的评估次数。
  • 引入一种直接渲染技术,跳过网格提取与纹理映射步骤,通过直接从隐式函数渲染实现更快的新视角合成。
  • 采用在线难例挖掘(OHEM)策略,根据重建误差自适应重加权训练样本,使模型更关注困难样本的学习。
  • 使用渐进式采样策略,在训练过程中提高采样困难样本(如罕见姿态、复杂衣着)的概率,以抑制伪影。
  • 在PIFu框架基础上构建高分辨率隐式3D几何与纹理表示,同时通过空间剪枝优化推理速度。
  • 结合分层定位与隐式纹理渲染,实现在256³分辨率下的端到端实时性能。

实验结果

研究问题

  • RQ1是否可以在不牺牲重建质量且无需多视角数据的前提下,将单目3D人体性能捕捉速度提升至实时?
  • RQ2如何在保留高保真几何与纹理的前提下,显著降低PIFu类隐式重建方法的高计算成本?
  • RQ3能否有效缓解合成训练数据中类别不平衡问题(尤其是罕见姿态与衣着样式),以提升泛化能力并减少伪影?
  • RQ4是否可行实现无需显式提取与三角化表面网格的实时新视角渲染?
  • RQ5在训练过程中采用自适应采样策略,是否可提升对挑战性输入条件的鲁棒性,而无需人工数据整理?

主要发现

  • 所提出的分层表面定位算法使基于PIFu的重建速度提升两个数量级,将每帧推理时间从30秒缩短至0.14秒。
  • 通过结合加速重建与无网格渲染,系统在256³分辨率下实现15 fps的完整体素化渲染,支持实时性能捕捉。
  • 在线难例挖掘(OHEM)技术显著减少了罕见姿态与复杂衣着下的重建伪影,提升了整体保真度与泛化能力。
  • 定性与定量评估表明,该方法在准确率与鲁棒性方面均优于当前最先进的单目重建方法,即使在无预捕获模板的情况下亦然。
  • 系统能够有效处理拓扑变化与动态纹理,实现对富有表现力表演的真实感渲染,而传统模板方法则难以做到。
  • 该方法具备泛化能力,不仅适用于人体,还可推广至任意物体或拓扑结构,为消费级摄像头提供可扩展的实时3D捕获基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。