[论文解读] DELTAR: Depth Estimation from a Light-weight ToF Sensor and RGB Image
DELTAR 提出了一种新颖的神经网络,通过融合来自轻量化飞行时间(ToF)传感器(8×8 区域)的低分辨率深度分布与 RGB 图像,生成高保真度的稠密深度图。通过使用感知分布的特征提取器和交叉注意力融合机制,其深度质量达到与主流 RGB-D 传感器(如英特尔 RealSense D435i)相当的水平,显著优于现有深度补全与超分辨率方法在低分辨率、基于分布输入下的表现。
Light-weight time-of-flight (ToF) depth sensors are small, cheap, low-energy and have been massively deployed on mobile devices for the purposes like autofocus, obstacle detection, etc. However, due to their specific measurements (depth distribution in a region instead of the depth value at a certain pixel) and extremely low resolution, they are insufficient for applications requiring high-fidelity depth such as 3D reconstruction. In this paper, we propose DELTAR, a novel method to empower light-weight ToF sensors with the capability of measuring high resolution and accurate depth by cooperating with a color image. As the core of DELTAR, a feature extractor customized for depth distribution and an attention-based neural architecture is proposed to fuse the information from the color and ToF domain efficiently. To evaluate our system in real-world scenarios, we design a data collection device and propose a new approach to calibrate the RGB camera and ToF sensor. Experiments show that our method produces more accurate depth than existing frameworks designed for depth completion and depth super-resolution and achieves on par performance with a commodity-level RGB-D sensor. Code and data are available at https://zju3dv.github.io/deltar/.
研究动机与目标
- 为解决从轻量化 ToF 传感器提供的极低分辨率(8×8)深度分布中生成高分辨率、高精度深度图的挑战。
- 克服现有深度补全与超分辨率方法的局限性,这些方法通常假设输入为更高分辨率或基于点云的深度数据。
- 设计一种联合学习框架,有效融合稀疏、概率性的深度分布与高分辨率 RGB 图像。
- 开发一种新型校准方法,用于在 RGB 与 ToF 传感器之间模态对应关系不明确时,实现两者对齐。
- 构建一个新的真实世界数据集(ZJU-L5),包含配对且像素对齐的 RGB 与 ToF 信号,用于模型训练与评估。
提出的方法
- 一种分布特征提取器在每个 8×8 区域内从 ToF 传感器的深度分布中采样深度假设,以保留概率信息。
- 一种交叉注意力机制融合来自 RGB 图像和采样深度假设的特征,显式建模图像块与深度分布之间的对应关系。
- 一种图像自注意力模块在全视场范围内传播上下文信息,实现与 RGB 图像对齐的稠密输出。
- 一种优化模块预测深度重建的通道宽度与线性系数,通过可微回归提升精度。
- 一种新型校准方法使用类似期望最大化(EM)的算法,从 ToF 信号中估计平面几何结构,随后通过点到平面优化估计 RGB 与 ToF 传感器之间的外参。
- 通过 NYU-Depth V2 生成合成 ToF 信号以增强真实世界数据,提升训练过程中的泛化能力。
实验结果
研究问题
- RQ1神经网络能否有效学习从轻量化 ToF 传感器的稀疏、基于分布的深度输入中重建稠密且高精度的深度图?
- RQ2如何设计跨模态注意力机制,以在融合 RGB 图像特征的同时保留深度分布的物理意义?
- RQ3在交叉注意力中建模图像块与深度分布之间的对应关系对深度估计有何影响?
- RQ4所提出的方法能否实现与主流 RGB-D 传感器(如英特尔 RealSense D435i)相当的深度质量?
- RQ5与直接输入均值/方差或简单拼接相比,引入概率采样与注意力机制对性能有何影响?
主要发现
- DELTAR 在相同任务上优于现有深度补全与超分辨率框架,尤其得益于其感知分布的特征提取与基于注意力的融合机制。
- 该方法将 ST VL53L5CX(L5)传感器的原始深度质量提升至与英特尔 RealSense D435i 相当的水平,尤其在 L5 传感器工作范围(最大 3 米)内表现更优。
- 消融实验表明,若移除图像自注意力或图像到深度分布的注意力机制,性能显著下降,证实了其在特征传播与融合中的关键作用。
- 采用基于概率的采样而非均匀采样,可使 RMSE 改善 0.3 cm,证明了建模分布不确定性的优势。
- 将优化模块替换为简单的两层解码器仅导致性能轻微下降,表明主要性能增益来源于特征提取器与注意力融合组件。
- 在平坦墙面上的定量评估显示,当距离低于 3000 mm 时,DELTAR 的偏差与抖动水平与 RealSense D435i 相当或更优,证实了其精度与鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。