Skip to main content
QUICK REVIEW

[论文解读] FlowStep3D: Model Unrolling for Self-Supervised Scene Flow Estimation

Yair Kittenplon, Yonina C. Eldar|arXiv (Cornell University)|Nov 19, 2020
Advanced Vision and Imaging参考文献 45被引用 9
一句话总结

FlowStep3D 提出了一种循环的、模型展开的架构,用于自监督的3D场景光流估计,通过强正则化和轻量级的全局相关机制,迭代地优化光流预测。该方法仅在合成的 FlyingThings3D 数据上进行训练,在 KITTI 自监督基准上实现了最先进性能,相较于之前的方法在真实世界 LiDAR 扫描上的泛化能力提升了 50% 以上。

ABSTRACT

Estimating the 3D motion of points in a scene, known as scene flow, is a core problem in computer vision. Traditional learning-based methods designed to learn end-to-end 3D flow often suffer from poor generalization. Here we present a recurrent architecture that learns a single step of an unrolled iterative alignment procedure for refining scene flow predictions. Inspired by classical algorithms, we demonstrate iterative convergence toward the solution using strong regularization. The proposed method can handle sizeable temporal deformations and suggests a slimmer architecture than competitive all-to-all correlation approaches. Trained on FlyingThings3D synthetic data only, our network successfully generalizes to real scans, outperforming all existing methods by a large margin on the KITTI self-supervised benchmark.

研究动机与目标

  • 为解决基于学习的 3D 场景光流估计在大形变和稀疏 LiDAR 数据下泛化能力差的挑战。
  • 在不依赖真实世界标注的情况下,提升自监督 3D 运动估计的鲁棒性与准确性。
  • 相比全连接相关方法,降低内存消耗,同时保持高性能。
  • 在无需微调的情况下,实现从合成数据(FlyingThings3D)到真实世界 LiDAR 扫描(KITTI)的有效泛化。

提出的方法

  • 该方法采用循环架构,展开 K 次迭代优化过程,逐次学习每一步的更新。
  • 通过全局相关单元在低分辨率下计算初始光流,随后通过基于 GRU 的更新单元进行迭代优化。
  • 在每次迭代中重新编码形变后的源点云,通过强正则化强制保持结构一致性。
  • 通过可学习的损失权重(αk, βk)施加正则化,以防止过度正则化(半刚性运动)或正则化不足(结构失真)。
  • 全连接相关机制在低分辨率的全局特征空间中应用,相比高分辨率方法显著降低了内存消耗。
  • 模型通过几何一致性与光流正则化实现端到端的自监督训练,从而实现对真实数据的零样本泛化。

实验结果

研究问题

  • RQ1与端到端学习相比,循环的、模型展开的架构是否能提升自监督 3D 场景光流估计的泛化能力?
  • RQ2通过强正则化的迭代优化,在大形变和稀疏 LiDAR 数据上是否能显著提升性能?
  • RQ3仅在合成数据上训练的网络,在无需微调的情况下,能在多大程度上泛化到真实世界 KITTI 扫描?
  • RQ4在迭代光流优化中,正则化强度与运动精度之间的最优权衡是什么?
  • RQ5轻量级的全连接相关机制是否能在保持高精度的同时,超越内存密集型的相关方法?

主要发现

  • 自监督的 FlowStep3D 在 KITTI 基准上实现了 0.1443 的 EPE3D,相较于所有现有自监督方法在泛化能力上提升超过 50%。
  • 在所有自监督方法中,该方法在 FlyingThings3D 上实现了低于 10m 的 EPE3D 最低值,达到 0.1443。
  • 全监督变体的性能与最先进方法 FLOT 相当,同时内存消耗更低,且异常值率更小。
  • 模型从迭代优化中受益:在 KITTI 上,超过 4 次迭代的推理进一步提升了性能。
  • 过度正则化使异常值增加至 0.8941,而正则化不足则使 EPE3D 上升至 0.3183,证实了最优正则化权重的重要性。
  • 使用 GRU 而非全连接层使泛化能力提升 40%;仅使用 flow_embedding 作为 GRU 输入则使误差增加 30%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。