[论文解读] CamLiFlow: Bidirectional Camera-LiDAR Fusion for Joint Optical Flow and Scene Flow Estimation
CamLiFlow 提出了一种端到端的双向相机-LiDAR 融合框架,用于联合估计光学流和场景流,采用模态特定的 2D 和 3D 分支,结合可学习的对称融合模块(Bi-CLFM)和逆深度缩放以平衡稀疏点云。该方法在 KITTI 和 FlyingThings3D 数据集上均达到最先进性能,参数量分别仅为 1/7 和 1/6,位列 KITTI 场景流基准测试第一名。
In this paper, we study the problem of jointly estimating the optical flow and scene flow from synchronized 2D and 3D data. Previous methods either employ a complex pipeline that splits the joint task into independent stages, or fuse 2D and 3D information in an "early-fusion" or "late-fusion" manner. Such one-size-fits-all approaches suffer from a dilemma of failing to fully utilize the characteristic of each modality or to maximize the inter-modality complementarity. To address the problem, we propose a novel end-to-end framework, called CamLiFlow. It consists of 2D and 3D branches with multiple bidirectional connections between them in specific layers. Different from previous work, we apply a point-based 3D branch to better extract the geometric features and design a symmetric learnable operator to fuse dense image features and sparse point features. Experiments show that CamLiFlow achieves better performance with fewer parameters. Our method ranks 1st on the KITTI Scene Flow benchmark, outperforming the previous art with 1/7 parameters. Code is available at https://github.com/MCG-NJU/CamLiFlow.
研究动机与目标
- 为解决先前方法在联合光学流与场景流估计中采用早期/晚期融合或模块化流水线所存在的局限性。
- 在密集 2D 图像特征与稀疏 3D LiDAR 点云特征之间实现有效、双向的特征融合,尽管二者在结构和密度上存在差异。
- 通过利用模态特定的网络架构和可学习的融合机制,最大化模态间的互补性,从而提升性能。
- 通过对称的多阶段融合与逆深度缩放技术,降低模型复杂度,同时保持或提升准确性。
提出的方法
- CamLiFlow 采用基于 PWC-Net 和基于点云的网络分别构建 2D 和 3D 分支,以保留模态特定的特征提取能力。
- 引入一种双向相机-LiDAR 融合模块(Bi-CLFM),通过可学习权重的插值与采样操作,在双向路径中实现可学习的对称特征融合。
- Bi-CLFM 在插值过程中引入 2D 图像相似性度量,以提升在存在重叠物体场景下的鲁棒性。
- 采用逆深度缩放(IDS)对 LiDAR 点云进行非线性重标定,基于逆深度平衡点云在不同距离上的密度分布,提升特征学习效果。
- 在多个阶段进行融合——特征提取、代价体积构建与流解码阶段——实现迭代优化与更优的跨模态信息交换。
- 框架采用端到端训练,结合对称可学习算子,确保图像分支与点云分支之间的一致性特征交互。
实验结果
研究问题
- RQ1多阶段、双向融合策略是否能在联合光学流与场景流估计中超越早期或晚期融合?
- RQ2当密集 2D 图像特征与稀疏 3D LiDAR 点云特征缺乏一一对应关系且密度差异显著时,如何实现有效融合?
- RQ3在融合过程中引入 2D 图像相似性是否能提升在存在遮挡的复杂场景下的鲁棒性?
- RQ4逆深度缩放是否能通过平衡点云的空间分布,提升稀疏 LiDAR 点云的特征学习效果?
- RQ5轻量化端到端模型是否能以远少于先前方法的参数量实现最先进性能?
主要发现
- CamLiFlow 在 KITTI 场景流基准测试中实现 4.43% 的端到端误差,性能优于此前最先进方法,且参数量仅为后者的 1/7。
- 在 FlyingThings3D 上,CamLiFlow 相较于 RAFT-3D 将端点误差降低 48.4%,同时参数量仅为后者的 1/6。
- 引入融合感知插值并结合 2D 相似性度量后,EPE 2D 从 2.30 降低至 2.18,ACC 1px 从 83.3% 提升至 84.5%。
- 逆深度缩放(IDS)在 LiDAR 仅用版本中使 EPE 3D 提升 2.7%,ACC .05 提升 2.7 个百分点,证明其在点云密度平衡方面的有效性。
- 在所有三个阶段(特征提取、代价体积、流解码)进行特征融合的性能最佳,显著优于早期/晚期融合及单阶段融合策略。
- 在 Tesla V100 GPU 上,960x540 图像的推理时间达到 118ms,其中点云分支为最耗时组件。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。