[论文解读] SparseFormer: Attention-based Depth Completion Network
SparseFormer 提出了一种基于 Transformer 的网络,用于使用 3D 从运动恢复结构(SfM)特征点和 RGB 图像完成极稀疏的深度估计。它采用全局注意力机制在非均匀分布的稀疏特征点之间插值深度,并通过带有交叉注意力的优化模块过滤异常值,在极低点密度下实现了室内(NYU Depth V2)和大规模室外(Mapillary Planet-Scale Depth)数据集上的最先进性能。
Most pipelines for Augmented and Virtual Reality estimate the ego-motion of the camera by creating a map of sparse 3D landmarks. In this paper, we tackle the problem of depth completion, that is, densifying this sparse 3D map using RGB images as guidance. This remains a challenging problem due to the low density, non-uniform and outlier-prone 3D landmarks produced by SfM and SLAM pipelines. We introduce a transformer block, SparseFormer, that fuses 3D landmarks with deep visual features to produce dense depth. The SparseFormer has a global receptive field, making the module especially effective for depth completion with low-density and non-uniform landmarks. To address the issue of depth outliers among the 3D landmarks, we introduce a trainable refinement module that filters outliers through attention between the sparse landmarks.
研究动机与目标
- 解决输入 3D 特征点极度稀疏、分布不均匀且易受异常值影响的深度补全挑战——这在 SfM 流程中很常见。
- 设计一种在稀疏 3D 点密度和空间分布变化下均具有良好泛化能力的方法。
- 通过利用 Transformer 的全局感受野,克服卷积网络在处理极稀疏数据时的局限性。
- 通过注意力机制融合视觉特征与稀疏 3D 特征点,实现基于相似性的深度插值,提升深度补全精度。
- 开发一个可训练的优化模块,用于在插值前检测并抑制 SfM 特征点中的深度异常值。
提出的方法
- 提出 SparseFormer 模块,通过将 2D 投影的 3D SfM 特征点与 CNN 解码器的视觉特征之间计算注意力体积,实现全局、基于相似性的深度插值。
- 在稀疏 3D 特征点与图像特征之间使用多头交叉注意力机制,计算注意力权重,以引导整个图像范围内的深度传播。
- 集成一个优化模块,将每个 SfM 特征点处的深度值与视觉特征拼接,并应用交叉注意力以过滤噪声或错误的点。
- 在 Monodepth2 的解码器中插入四个 SparseFormer 模块,结合多尺度监督与加权损失,以提升特征学习与深度精度。
- 使用 Adam 优化器、学习率衰减、批量大小 24,在 NYU Depth V2 和 Mapillary Planet-Scale Depth 数据集上训练 600k 次迭代。
- 利用自注意力的全局上下文,在每帧仅提供 300 个点(0.1% 密度)时仍能有效扩散深度。
实验结果
研究问题
- RQ1与卷积方法相比,基于 Transformer 的模块是否能在极稀疏、非均匀分布的 SfM 特征点上实现更优的深度补全性能?
- RQ2SparseFormer 中的全局注意力机制如何处理极端稀疏性(例如,少于 0.1% 像素具有深度)和非均匀特征点分布?
- RQ3基于交叉注意力的可训练优化模块在多大程度上能减轻 SfM 特征点中深度异常值对最终预测的影响?
- RQ4基于注意力的插值机制是否能在具有不同特征点密度和空间分布的多样化场景与数据集上实现良好泛化?
- RQ5在定量指标和定性深度图质量方面,该方法与 SOTA 基线方法(如 ENet 和 Monodepth2)相比表现如何?
主要发现
- 在 NYU Depth V2 数据集上,SparseFormer 实现 REL 为 0.011,RMSE 为 4.948,δ1 为 0.989,优于 ENet(REL: 0.019,RMSE: 5.469,δ1: 0.975)和 Monodepth2 在低点密度下的表现。
- 在 Mapillary Planet-Scale Depth 数据集上,SparseFormer 显著优于 Monodepth2 和 ENet,展现出在 0.1% 特征点密度下大规模真实室外场景中的鲁棒性。
- 即使每帧仅有 330 个 SfM 特征点(0.1% 密度),模型仍保持高精度,表明其对超稀疏输入具有强大泛化能力。
- 在 MPSD 上的定性结果表明,SparseFormer 生成的深度图具有一致性与细节,即使在无纹理或遮挡区域也与真实值高度对齐。
- 消融研究证实,优化模块通过过滤异常值显著提升了性能,尤其在特征点质量较低时效果更明显。
- 全局注意力机制使深度能在极少数输入点下仍有效扩散至大范围图像区域,而局部卷积操作则难以实现这一效果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。