[论文解读] RAFT-3D: Scene Flow using Rigid-Motion Embeddings
RAFT-3D 提出了一种基于刚性运动嵌入和可微分 Dense-SE3 层的端到端深度学习框架,用于 3D 场景光流估计,以强制实现几何一致性。该方法在 FlyingThings3D 上将 3D 准确率(δ<0.05)提升至 83.7%,在 KITTI 上实现 5.77 的 EPE,优于先前方法,且无需实例级监督。
We address the problem of scene flow: given a pair of stereo or RGB-D video frames, estimate pixelwise 3D motion. We introduce RAFT-3D, a new deep architecture for scene flow. RAFT-3D is based on the RAFT model developed for optical flow but iteratively updates a dense field of pixelwise SE3 motion instead of 2D motion. A key innovation of RAFT-3D is rigid-motion embeddings, which represent a soft grouping of pixels into rigid objects. Integral to rigid-motion embeddings is Dense-SE3, a differentiable layer that enforces geometric consistency of the embeddings. Experiments show that RAFT-3D achieves state-of-the-art performance. On FlyingThings3D, under the two-view evaluation, we improved the best published accuracy (d < 0.05) from 34.3% to 83.7%. On KITTI, we achieve an error of 5.77, outperforming the best published method (6.31), despite using no object instance supervision. Code is available at https://github.com/princeton-vl/RAFT-3D.
研究动机与目标
- 开发一种无需实例级监督的端到端可微分 3D 场景光流估计架构。
- 通过刚性运动嵌入将 3D 运动建模为密集的 SE3 场,实现像素到刚性物体的软分组。
- 利用基于展开高斯-牛顿迭代的可微分优化层 Dense-SE3,强制实现运动场中的几何一致性。
- 在 FlyingThings3D 和 KITTI 等标准基准上提升准确率,同时保持对未见物体的泛化能力。
- 仅依赖 3D 场景光流真值实现自监督,避免使用边界框或分割掩码。
提出的方法
- RAFT-3D 将 RAFT 光流框架扩展至在 SE3(特殊欧氏群)中估计密集 3D 运动场,而非 2D 流。
- 利用从立体或 RGB-D 图像对中提取的特征构建 4D 相关体积,以捕捉像素对之间的视觉相似性。
- 模型维护并迭代更新一个密集的 SE3 运动估计场,使用基于 GRU 的更新算子预测对应关系和嵌入更新。
- 刚性运动嵌入是每个像素的向量,通过软分组将像素归入刚性物体,相似嵌入表示共享的 3D 运动。
- Dense-SE3 是一个可微分层,通过在邻域内所有像素对上求解最小二乘优化问题,基于当前嵌入和对应估计强制实现几何一致性。
- 该方法集成了逆深度修正,并可选择性地应用双三次平滑层,以改善运动边界处的嵌入聚合。
实验结果
研究问题
- RQ1一个可微分、端到端的深度网络是否能在无需实例级监督(如边界框或分割掩码)的情况下,准确估计 3D 场景光流?
- RQ2刚性运动嵌入是否能有效建模像素到刚性运动物体的软分组,同时保持 3D 运动场中的几何一致性?
- RQ3与标准学习方法相比,集成可微分几何约束层(Dense-SE3)是否能显著提升 3D 运动估计的准确率?
- RQ4RAFT-3D 在 FlyingThings3D 和 KITTI 等标准基准上的性能如何,特别是在对未见物体类别实现零样本泛化时?
- RQ5邻域半径、迭代次数和双三次平滑层等架构组件对最终准确率和鲁棒性有何影响?
主要发现
- 在两视图评估下,RAFT-3D 在 FlyingThings3D 上实现了 83.7% 的 3D 准确率(δ<0.05),相比之前最佳的 34.3% 有显著提升。
- 在 KITTI 数据集上,RAFT-3D 实现了 5.77 的 EPE,优于最佳公开方法(6.31),且未使用任何实例监督。
- 消融实验表明,使用 256 像素的邻域半径优于更小半径或全图优化,表明其对物体尺寸具有有益的归纳偏差。
- 在更新算子中引入逆深度修正,通过利用深度一致性,使 δ<0.05 提升至 87.1%(从 84.6% 提高)。
- 双三次平滑层使 δ<0.05 和 δ<0.10 的阈值指标分别提升 0.7%,且平均 EPE 无下降,同时增强了运动边界的一致性。
- 该模型在 540x960 分辨率图像上使用单张 GTX 1080Ti GPU 实现了 SOTA 性能,参数量为 45M,推理时间为 386ms。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。