Skip to main content
QUICK REVIEW

[论文解读] PV-RAFT: Point-Voxel Correlation Fields for Scene Flow Estimation of Point Clouds

Yi Wei, Ziyi Wang|arXiv (Cornell University)|Dec 2, 2020
Advanced Vision and Imaging参考文献 49被引用 4
一句话总结

PV-RAFT 提出了一种新颖的点-体素相关场机制,通过结合基于 K-最近邻(KNN)的点相关性以捕捉局部细节,以及多尺度体素化相关场以建模长程依赖,从而从点云中估计 3D 场景光流。该方法在 FlyingThings3D 和 KITTI Scene Flow 2015 数据集上实现了最先进性能,通过基于 GRU 的迭代优化和一种内存高效的截断策略,显著优于先前方法。

ABSTRACT

In this paper, we propose a Point-Voxel Recurrent All-Pairs Field Transforms (PV-RAFT) method to estimate scene flow from point clouds. Since point clouds are irregular and unordered, it is challenging to efficiently extract features from all-pairs fields in the 3D space, where all-pairs correlations play important roles in scene flow estimation. To tackle this problem, we present point-voxel correlation fields, which capture both local and long-range dependencies of point pairs. To capture point-based correlations, we adopt the K-Nearest Neighbors search that preserves fine-grained information in the local region. By voxelizing point clouds in a multi-scale manner, we construct pyramid correlation voxels to model long-range correspondences. Integrating these two types of correlations, our PV-RAFT makes use of all-pairs relations to handle both small and large displacements. We evaluate the proposed method on the FlyingThings3D and KITTI Scene Flow 2015 datasets. Experimental results show that PV-RAFT outperforms state-of-the-art methods by remarkable margins.

研究动机与目标

  • 解决从不规则、无序点云中准确估计 3D 场景光流的挑战。
  • 通过捕捉局部与长程全对依赖关系,克服现有方法仅依赖局部或粗粒度相关性的局限。
  • 开发一种高效、内存优化的框架,通过迭代优化与相关性截断保持高精度。
  • 在包括合成数据(FlyingThings3D)和真实世界数据(KITTI)在内的多样化点云数据集上具有良好泛化能力。

提出的方法

  • 提出点-体素相关场,整合基于 KNN 的点相关性以提取细粒度局部特征,以及多尺度体素化相关场以建模长程依赖。
  • 采用基于 GRU 的循环更新机制,利用点级与体素级相关特征,迭代优化场景光流预测。
  • 应用截断机制,仅保留前 M 个相关性得分,降低内存使用量而不损失性能。
  • 使用特征编码器提取每个点的特征,随后通过优化模块平滑最终的场景光流输出。
  • 在多个尺度上构建体素网格金字塔,以在不同空间分辨率下建模长程对应关系。
  • 采用自粗到精的迭代策略,结合受 RAFT 启发的全对相关场变换,专为 3D 点云设计。

实验结果

研究问题

  • RQ1将基于点和基于体素的相关场相结合,是否能相比仅依赖单一模态的方法,提升 3D 点云中的场景光流估计性能?
  • RQ2所提出的点-体素相关场在捕捉不规则 3D 点云中局部与长程依赖关系方面有多有效?
  • RQ3截断机制在全对相关学习中,能在多大程度上降低内存消耗,同时保持预测精度?
  • RQ4基于 GRU 的迭代优化结合点-体素联合相关性,是否能提升在 FlyingThings3D 和 KITTI 等多样化数据集上的泛化能力?
  • RQ5所提出方法是否能在标准基准上同时实现更高的准确率与效率,超越现有最先进方法?

主要发现

  • 在 KITTI Scene Flow 2015 数据集上,PV-RAFT 实现了 0.0461 的平均端到端误差(EPE),显著优于先前方法如 FlowNet3D(0.0704)和 PointPWC-Net(0.0614)。
  • 在 FlyingThings3D 数据集上,PV-RAFT 实现了 0.0585 的 EPE 和 0.7113 的严格精度,展现出跨数据集的强大泛化能力。
  • 消融研究证实,点相关性和体素相关性两部分均至关重要,任一移除均导致性能下降。
  • 当 M=512 时,截断操作达到最佳平衡——将内存使用量降低至 10.7GB,同时保持最优性能(EPE: 0.0461,精度: 0.8169)。
  • 可视化结果表明,当光流预测不准确时,体素相关性引导初始预测;随着预测收敛,点相关性则用于精炼定位。
  • 该方法在真实世界数据上泛化良好,在 KITTI 基准上实现了最先进结果,该基准包含复杂的真实世界运动与噪声。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。