Skip to main content
QUICK REVIEW

[论文解读] Deformable Filter Convolution for Point Cloud Reasoning

Yuwen Xiong, Mengye Ren|arXiv (Cornell University)|Jul 30, 2019
3D Shape Modeling and Analysis参考文献 44被引用 16
一句话总结

本文提出可变形滤波卷积(Deformable Filter Convolution),一种可学习的3D卷积层,能够根据点云几何结构自适应调整滤波器形状,而非依赖固定的体素网格。通过将滤波器变形以匹配局部点云结构,并通过输入和输出流将该方法集成到体素化主干网络中,该方法在LiDAR语义分割任务上达到最先进性能,并在目标检测任务中取得显著提升,尤其在稀有或稀疏类别(如骑行人)上表现突出。

ABSTRACT

Point clouds are the native output of many real-world 3D sensors. To borrow the success of 2D convolutional network architectures, a majority of popular 3D perception models voxelize the points, which can result in a loss of local geometric details that cannot be recovered. In this paper, we propose a novel learnable convolution layer for processing 3D point cloud data directly. Instead of discretizing points into fixed voxels, we deform our learnable 3D filters to match with the point cloud shape. We propose to combine voxelized backbone networks with our deformable filter layer at 1) the network input stream and 2) the output prediction layers to enhance point level reasoning. We obtain state-of-the-art results on LiDAR semantic segmentation and producing a significant gain in performance on LiDAR object detection.

研究动机与目标

  • 为解决体素化3D CNN中因将连续点云离散化为固定网格而导致的局部几何细节丢失问题。
  • 克服现有基于点的网络缺乏空间归纳偏差、在稀疏或非均匀点云上表现不佳的局限性。
  • 开发一种可学习的卷积层,结合体素化卷积的归纳偏差与直接点处理的几何灵活性。
  • 通过在输入和输出阶段融合点级特征,提升体素化主干网络中的点级推理能力。
  • 在不完全依赖体素化或复杂基于点的架构的前提下,实现在大规模LiDAR基准上的最先进性能。

提出的方法

  • 提出一种可变形3D滤波卷积层,学习将卷积核形状变形以匹配局部点云几何结构,而非应用固定的体素网格。
  • 利用可学习的形变场,根据局部点云结构调整滤波器位置和形状,实现空间连续且自适应的特征聚合。
  • 通过两条路径将可变形滤波层集成到体素化网络中:辅助输入流用于增强特征表示,残差输出流用于平滑局部预测。
  • 采用多层感知机(MLP)为每个滤波器预测形变偏移量,使滤波器能够动态适应局部点密度和空间构型。
  • 通过将标准点卷积全连接层替换为新层,在PointNet和PointNet++架构中应用可变形卷积,同时保持网络深度和宽度。
  • 在KITTI和ModelNet40基准上使用SGD带动量进行训练,采用标准数据增强和学习率衰减策略。

实验结果

研究问题

  • RQ1一种可学习的3D卷积层,若能根据局部点云几何结构自适应变形其滤波器形状,是否可在固定体素化之外实现更优的3D感知性能?
  • RQ2通过可变形滤波器将点级特征融合到体素化主干网络中,是否能提升语义分割与目标检测性能?
  • RQ3在稀疏或非均匀点云上,该可变形滤波层与现有可学习连续卷积方法相比,在鲁棒性与性能方面表现如何?
  • RQ4所提方法是否能在不依赖端到端基于点的网络的前提下,实现在TOR4D等大规模LiDAR基准上的最先进结果?
  • RQ5所学滤波器形状为何种形态?其在捕捉复杂几何模式方面与线性或固定滤波器有何不同?

主要发现

  • 所提方法在TOR4D大规模LiDAR语义分割基准上达到最先进性能,优于仅使用体素化或先前融合方法的模型。
  • 在KITTI验证集上,该方法使PointNet的平均精度均值(mAP)提升1.8%,PointNet++提升1.0%(在ModelNet40分类任务上)。
  • 在稀有且稀疏的类别(如骑行人)上,可变形滤波层带来显著性能提升,而此前方法(如PCC)因数据稀缺导致性能下降。
  • 可视化结果表明,所学滤波器具有非线性且表达能力强,能自适应复杂3D形状,而非受限于刚性或对称形式。
  • 在目标检测任务中,mAP相较HDNet基线提升显著:汽车类提升1.8%,行人类提升2.1%,骑人类提升3.5%。
  • 消融研究证实,输入流与输出流的集成均对性能提升有贡献,其中输出流在细化局部预测方面尤为有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。