[论文解读] RGB-D Local Implicit Function for Depth Completion of Transparent Objects
本文提出了一种基于射线-体素对的局部隐式深度函数(LIDF)的快速、可泛化的透明物体深度补全方法,实现实时推理与卓越的准确性。该方法结合可学习的局部隐式表示与迭代优化,相较于SOTA方法在合成数据集与真实世界基准测试中表现更优,且推理速度比ClearGrasp快20倍。
Majority of the perception methods in robotics require depth information provided by RGB-D cameras. However, standard 3D sensors fail to capture depth of transparent objects due to refraction and absorption of light. In this paper, we introduce a new approach for depth completion of transparent objects from a single RGB-D image. Key to our approach is a local implicit neural representation built on ray-voxel pairs that allows our method to generalize to unseen objects and achieve fast inference speed. Based on this representation, we present a novel framework that can complete missing depth given noisy RGB-D input. We further improve the depth estimation iteratively using a self-correcting refinement model. To train the whole pipeline, we build a large scale synthetic dataset with transparent objects. Experiments demonstrate that our method performs significantly better than the current state-of-the-art methods on both synthetic and real world data. In addition, our approach improves the inference speed by a factor of 20 compared to the previous best method, ClearGrasp. Code and dataset will be released at https://research.nvidia.com/publication/2021-03_RGB-D-Local-Implicit.
研究动机与目标
- 解决透明物体深度补全的挑战,因其在标准RGB-D传感器下因光线折射与吸收而不可见。
- 克服现有方法依赖接触边缘、物理先验或推理速度缓慢的局限性。
- 通过可学习的局部隐式表示,实现对未见透明物体的泛化能力与真实世界部署。
- 构建可扩展的合成数据集,以弥合透明物体感知的模拟到现实的差距。
- 实现高精度深度补全并具备快速推理能力,适用于实时机器人应用。
提出的方法
- 提出一种局部隐式深度函数(LIDF),将深度建模为相机射线与其相交体素的函数,实现局部化、高效的推理。
- 使用位置编码增强特征表示,捕捉隐式函数中的精细几何细节。
- 对射线-体素对应用argmax池化,选择最可能的终止体素,降低远处体素带来的噪声。
- 学习每个体素内的偏移量,以精确预测射线的终止点,替代NeRF中使用的启发式3D点采样方法。
- 集成自校正优化模块,通过RGB图像、输入深度图与LIDF输出,迭代优化深度预测结果。
- 在大规模合成数据集Omnivers Object上端到端训练整个流程,该数据集通过NVIDIA Omniverse生成,涵盖多种物体类型、光照条件与视角。

实验结果
研究问题
- RQ1基于射线-体素对的局部隐式神经表示能否在透明物体深度补全中泛化到未见的透明物体?
- RQ2通过体素内偏移量预测学习深度是否在准确率与效率上优于启发式3D点采样?
- RQ3自校正优化模块是否能在推理阶段无需真实几何信息的情况下提升深度补全的准确率?
- RQ4大规模合成数据集在多大程度上提升了对真实世界透明物体的零样本泛化能力?
- RQ5所提方法是否能在保持SOTA准确率的同时实现实时推理?
主要发现
- 在同时使用ClearGrasp与Omnivers Object数据集进行训练时,该方法在真实世界新物体上的测试RMSE达到0.028,优于仅使用任一数据集训练的结果。
- 与ClearGrasp相比,推理速度提升20倍,支持实时部署。
- 采用体素特征上的argmax射线池化方法,在δ₁.₀₅指标上达到65.17%的准确率,显著优于加权求和操作符(59.31%)。
- 位置编码提升了对细粒度细节的捕捉能力,使δ₁.₀₅指标提高12.3个百分点,相比无编码情况。
- 学习体素内偏移量可实现0.028的RMSE,优于启发式点采样方法(0.038 RMSE)的深度预测性能。
- 仅使用Omnivers Object数据集进行训练,即可显著提升对真实世界新透明物体的泛化能力,δ₁.₂₅达到99.43%。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。