[论文解读] Weakly Supervised Learning of Rigid 3D Scene Flow
本文提出了一种弱监督的深度学习方法,用于3D场景光流估计,将场景建模为刚性运动物体,仅使用二值前景/背景掩码和自运动标注,而非密集光流标签。通过在物体级别强制实施刚性约束并引入推理时优化,该方法在多个自动驾驶基准测试中实现了最先进性能,在KITTI数据集上的终点误差相比先前方法降低了超过30厘米。
We propose a data-driven scene flow estimation algorithm exploiting the observation that many 3D scenes can be explained by a collection of agents moving as rigid bodies. At the core of our method lies a deep architecture able to reason at the extbf{object-level} by considering 3D scene flow in conjunction with other 3D tasks. This object level abstraction, enables us to relax the requirement for dense scene flow supervision with simpler binary background segmentation mask and ego-motion annotations. Our mild supervision requirements make our method well suited for recently released massive data collections for autonomous driving, which do not contain dense scene flow annotations. As output, our model provides low-level cues like pointwise flow and higher-level cues such as holistic scene understanding at the level of rigid objects. We further propose a test-time optimization refining the predicted rigid scene flow. We showcase the effectiveness and generalization capacity of our method on four different autonomous driving datasets. We release our source code and pre-trained models under \url{github.com/zgojcic/Rigid3DSceneFlow}.
研究动机与目标
- 为解决在最小监督下实现精确3D场景光流估计的挑战,减少对昂贵密集光流标注的依赖。
- 通过将运动建模为物体的刚性变换,提升动态3D场景理解的泛化能力和鲁棒性。
- 实现在缺乏密集场景光流标注的大规模真实世界数据集上的有效训练与推理。
- 提供可解释的、基于物体的场景表征,同时支持低层次光流与高层次场景理解。
提出的方法
- 该方法将场景分解为前景(刚性运动物体)和背景(静态),将背景光流建模为自运动,前景光流则按每个物体建模为刚性变换。
- 一个深度神经网络为每个分割出的刚性代理预测变换参数(旋转和平移),并据此计算每个点的刚性场景光流。
- 网络通过弱监督进行训练,仅使用二值实例掩码和自运动数据,这些数据通常可从IMU或简单分割中获得。
- 推理时优化通过联合优化物体级别变换和点级别光流对齐,以细化预测的刚性场景光流。
- 该方法采用带松弛行和列的熵正则化Sinkhorn算法,计算稳健的自运动估计对应的软对应图。
- 该架构具有灵活性,可适应多种3D任务,包括语义分割和实例级别刚性损失。
实验结果
研究问题
- RQ1是否可以仅使用二值前景/背景掩码和自运动标注,而非密集光流监督,有效学习3D场景光流估计?
- RQ2与无约束的逐点光流预测相比,将运动建模为物体的刚性变换在光流精度和泛化能力方面有何提升?
- RQ3推理时优化在多大程度上能细化预测的场景光流,并改善连续LiDAR帧之间的对齐?
- RQ4当实例标注存在噪声或缺失时,该方法在新数据集上无需微调的泛化能力如何?
主要发现
- 与之前最先进方法相比,该方法在KITTI数据集上的终点误差降低了超过30厘米,显著提升了性能。
- 即使在训练或推理阶段未使用真实实例掩码,该方法性能仍可与使用真实掩码的模型相媲美,验证了无监督聚类策略的有效性。
- 消融实验表明,Sinkhorn算法显著提升了自运动估计性能,相比使用原始亲和矩阵,RTE和RRE降低了40%以上。
- 在Waymo Open数据集上进行微调可提升鲁棒性,尤其在靠近传感器的物体及高物体数量场景中表现更优,优于直接零样本迁移。
- 该方法无需额外微调即可有效泛化至Waymo Open数据集,展现出强大的零样本迁移能力。
- 失败案例主要源于lidarKITTI中的噪声真实标注(如物体边界标注错误)或Waymo中罕见/未见过的物体,而非模型本身固有的局限性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。