[论文解读] 3DFS: Deformable Dense Depth Fusion and Segmentation for Object Reconstruction from a Handheld Camera
本文提出3DFS,一种从手持摄像头视频中实现单个物体精确三维重建与分割的方法。该方法通过使用旋转不变的弯曲能量先验改进密集深度估计,利用带零交叉校正的软最大值符号距离函数融合深度图,并通过图割算法联合执行2D-3D分割,在存在姿态误差和深度不准确的情况下,仍能对无纹理和高光表面实现鲁棒结果。
We propose an approach for 3D reconstruction and segmentation of a single object placed on a flat surface from an input video. Our approach is to perform dense depth map estimation for multiple views using a proposed objective function that preserves detail. The resulting depth maps are then fused using a proposed implicit surface function that is robust to estimation error, producing a smooth surface reconstruction of the entire scene. Finally, the object is segmented from the remaining scene using a proposed 2D-3D segmentation that incorporates image and depth cues with priors and regularization over the 3D volume and 2D segmentations. We evaluate 3D reconstructions qualitatively on our Object-Videos dataset, comparing to fusion, multiview stereo, and segmentation baselines. We also quantitatively evaluate the dense depth estimation using the RGBD Scenes V2 dataset [Henry et al. 2013] and the segmentation using keyframe annotations of the Object-Videos dataset.
研究动机与目标
- 实现无需用户交互的单个物体从手持摄像头视频中全自动三维重建。
- 在无纹理和高光表面等挑战性条件下,提升深度图的准确性。
- 通过用软最大值符号距离函数替代TSDF中的截断操作,增强体素融合对深度误差的鲁棒性。
- 通过结合使用先验和正则化联合优化2D图像与3D体素标签,实现精确的物体分割。
- 生成适用于3D打印和增强现实应用的高质量、平滑的三维网格。
提出的方法
- 提出一种新颖的密集深度估计目标函数,结合多视角立体视觉线索、来自VSLAM的稀疏点云以及旋转不变的二阶弯曲能量以保证表面平滑性。
- 用基于软最大值的符号距离函数(SDF)替代传统TSDF的截断操作,以提升对深度图误差的鲁棒性并生成更平滑的表面。
- 引入形变步骤,通过PMVS生成的稀疏表面点云对齐,校正软最大值融合引起的SDF零交叉偏移。
- 通过图割优化实现联合2D-3D分割,其中像素与体素通过图像颜色、深度线索和3D连续性先验相互约束。
- 使用基于超像素的单一场所和基于体素的单一场所,以在不同视角之间和3D体积内部保持一致性。
- 采用抠图初始化与谱马特ting作为替代分割方法,尽管计算成本较高,限制了其在多视角设置中的应用。
实验结果
研究问题
- RQ1与仅使用2D或仅使用3D的方法相比,联合2D-3D分割框架是否能提升物体重建的准确性?
- RQ2在存在深度图误差的情况下,带有零交叉校正的软最大值符号距离函数是否优于传统的截断SDF?
- RQ3弯曲能量先验是否能提升无纹理和高光表面上的深度图质量?
- RQ4将PMVS生成的稀疏点云集成进来,如何改善SDF形变与表面重建效果?
- RQ5在复杂场景中,对像素与体素进行联合推理在多大程度上减少了分割误差?
主要发现
- 所提出的带有弯曲能量正则化的深度估计方法在Object-Videos和RGBD Scenes v2数据集上均优于基线正则化方法。
- 经形变校正的软最大值SDF融合在表面平滑性和重建质量方面显著优于标准TSDF,尤其在存在深度误差的区域表现更优。
- 联合2D-3D分割(2D-3D GC Pixel)在除两例外的所有情况下均优于仅2D分割,证明了3D一致性约束的优势。
- 通过联合2D-3D分割生成的基于体素的3D模型(2D-3D GC Voxel)比对形状雕刻法更精确,后者对图像级误差较为敏感。
- 将形变SDF生成的网格与2D-3D GC Voxel结果结合,可获得最富视觉吸引力的3D重建效果,尽管其轮廓精度略低于仅使用2D-3D GC Voxel的结果。
- 相机位姿估计误差仍是主要的失败模式,尤其在模糊或快速运动的序列中,严重影响深度图质量和分割一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。