Skip to main content
QUICK REVIEW

[论文解读] DiffuStereo: High Quality Human Reconstruction via Diffusion-based Stereo Using Sparse Cameras

Ruizhi Shao, Zerong Zheng|arXiv (Cornell University)|Jul 16, 2022
Advanced Vision and Imaging被引用 4
一句话总结

DiffuStereo 提出了一种新颖的3D人体重建系统,仅使用八个稀疏RGB相机,通过引入基于扩散模型的立体匹配模块,以亚像素精度迭代优化深度图。该方法实现了媲美密集相机阵列的高质量、高细节3D重建效果,在亚毫米级重建精度上优于当前最先进方法超过42%,与粗略初始模型相比,Chamfer距离降低了54.4%。

ABSTRACT

We propose DiffuStereo, a novel system using only sparse cameras (8 in this work) for high-quality 3D human reconstruction. At its core is a novel diffusion-based stereo module, which introduces diffusion models, a type of powerful generative models, into the iterative stereo matching network. To this end, we design a new diffusion kernel and additional stereo constraints to facilitate stereo matching and depth estimation in the network. We further present a multi-level stereo network architecture to handle high-resolution (up to 4k) inputs without requiring unaffordable memory footprint. Given a set of sparse-view color images of a human, the proposed multi-level diffusion-based stereo network can produce highly accurate depth maps, which are then converted into a high-quality 3D human model through an efficient multi-view fusion strategy. Overall, our method enables automatic reconstruction of human models with quality on par to high-end dense-view camera rigs, and this is achieved using a much more light-weight hardware setup. Experiments show that our method outperforms state-of-the-art methods by a large margin both qualitatively and quantitatively.

研究动机与目标

  • 为解决从稀疏视角RGB相机实现高精度3D人体重建的挑战,当前基于学习的方法因过度依赖外观线索而非跨视角对应关系而难以实现该目标。
  • 通过将扩散模型整合到迭代立体匹配中,克服现有立体匹配方法的局限性(如离散代价体素与低分辨率),实现连续的、亚像素级别的优化。
  • 设计一种内存高效的多级网络架构,能够在不产生过高内存消耗的前提下处理高达4K分辨率的输入。
  • 通过结合基于扩散模型的立体匹配与轻量级多视角融合策略,实现在轻量化硬件上的高保真3D重建,同时处理校准误差与遮挡问题。

提出的方法

  • 提出一种新颖的基于扩散模型的立体匹配模块,利用自定义扩散核与立体约束,在二维光流域中迭代优化视差流。
  • 采用两级网络架构:全局层级用于从下采样图像中提取语义特征,扩散层级则将这些特征整合进基于扩散模型的立体匹配网络,实现迭代优化。
  • 扩散网络以多视角特征与对极约束为条件,确保立体一致性,并在稀疏视角设置下提升几何精度。
  • 在两级架构中采用基于图像块的训练策略,以缓解处理高分辨率输入时的内存瓶颈。
  • 设计一种高效的多视角融合策略,通过非刚性ICP对齐优化后的深度点云与粗略人体模型,并在融合深度图时处理校准误差与遮挡问题。
  • 系统从DoubleField生成的粗略3D人体网格开始,随后用于渲染初始深度图与视差流,供扩散模型进行优化。

实验结果

研究问题

  • RQ1扩散模型能否被有效适配于稀疏视角RGB输入的立体匹配任务,以实现高精度3D人体重建?
  • RQ2基于扩散的立体匹配如何在不产生过高内存开销的前提下,实现亚像素精度并处理4K高分辨率输入?
  • RQ3与现有迭代立体匹配或隐式学习方法相比,基于扩散的立体匹配模块在几何细节与重建精度方面能提升多少?
  • RQ4在真实稀疏视角设置中,该方法对初始模型误差与校准不准确的鲁棒性如何?

主要发现

  • 与DoubleField生成的粗略模型相比,本方法将Chamfer距离降低了54.4%,P2S误差降低了44.1%,显著提升了几何精度。
  • 在亚毫米级重建精度方面,本方法优于以往最先进方法超过42%,证明其在保留精细几何细节方面的优越性。
  • 所提出的基于扩散模型的立体匹配网络即使在仅使用八台相机的稀疏视角条件下,也能生成具有亚像素精度的高质量深度图。
  • 仅使用30次反向步骤,扩散模型在约12秒内即可完成八视角的高质量结果生成,相比原始1000步扩散模型实现了95%的加速。
  • 消融实验证实,所提出的扩散核相比原始核更加稳定且准确,在某些情况下原始核会产生噪声结果。
  • 即使初始几何使用八视角的视觉外壳(visual hull)构建,该方法仍能成功恢复可见区域的精细几何细节,表现出对粗略初始几何的强鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。