Skip to main content
QUICK REVIEW

[論文レビュー] CamLiFlow: Bidirectional Camera-LiDAR Fusion for Joint Optical Flow and Scene Flow Estimation

Haisong Liu, Tao Lu|arXiv (Cornell University)|Nov 20, 2021
Advanced Vision and Imaging参考文献 52被引用数 4
ひとこと要約

CamLiFlow は、可変深度スケーリングと学習可能な対称的融合モジュール(Bi-CLFM)を用いた、エンドツーエンドで双方向なカメラ-LiDAR フュージョンフレームワークを提案し、光学フローとシーンフローの推定を統合的に行う。KITTI および FlyingThings3D ベンチマークにおいて、それぞれ 1/7 および 1/6 のパラメータで最先端の性能を達成し、KITTI Scene Flow ベンチマークで1位を獲得した。

ABSTRACT

In this paper, we study the problem of jointly estimating the optical flow and scene flow from synchronized 2D and 3D data. Previous methods either employ a complex pipeline that splits the joint task into independent stages, or fuse 2D and 3D information in an "early-fusion" or "late-fusion" manner. Such one-size-fits-all approaches suffer from a dilemma of failing to fully utilize the characteristic of each modality or to maximize the inter-modality complementarity. To address the problem, we propose a novel end-to-end framework, called CamLiFlow. It consists of 2D and 3D branches with multiple bidirectional connections between them in specific layers. Different from previous work, we apply a point-based 3D branch to better extract the geometric features and design a symmetric learnable operator to fuse dense image features and sparse point features. Experiments show that CamLiFlow achieves better performance with fewer parameters. Our method ranks 1st on the KITTI Scene Flow benchmark, outperforming the previous art with 1/7 parameters. Code is available at https://github.com/MCG-NJU/CamLiFlow.

研究の動機と目的

  • 従来手法が統合的光学フローとシーンフロー推定に早期/後期フュージョンやモジュラーなパイプラインを用いるという限界を是正すること。
  • 構造的・密度的差異を有する高密度2次元画像特徴と低密度3次元LiDAR点群特徴の間で、効果的な双方向特徴フュージョンを実現すること。
  • モダリティ固有のアーキテクチャと学習可能なフュージョンメカニズムを活用し、モダリティ間の相補性を最大化することで、性能を向上させること。
  • 対称的でマルチステージのフュージョンと逆深度スケーリングを用いることで、モデルの複雑さを低減しつつ、精度を維持または向上させること。

提案手法

  • CamLiFlow は、PWC-Net と点ベースのネットワークに基づく、2次元および3次元の分離ブランチを採用し、モダリティ固有の特徴抽出能力を保持する。
  • 双方向カメラ-LiDAR フュージョンモジュール(Bi-CLFM)を導入し、補間とサンプリングを用いた学習可能な対称的特徴フュージョンを両方向で実現する。
  • 補間プロセスに2次元画像の類似度測定値を組み込むことで、重複する物体があるシーンにおけるロバスト性を向上させる。
  • LiDAR ポイントを逆深度に基づいて非線形に再スケーリングする逆深度スケーリング(IDS)を適用し、距離に応じた点群密度のバランスを図り、特徴学習を改善する。
  • 特徴抽出、コストボリューム、フローデコーディングの3段階でフュージョンを実施することで、反復的フィードバックとより良いクロスモダリティ情報交換を可能にする。
  • 対称的な学習可能な演算子を用いたエンドツーエンドの学習により、画像ブランチと点群ブランチ間の一貫性ある特徴相互作用を保証する。

実験結果

リサーチクエスチョン

  • RQ1マルチステージで双方向のフュージョン戦略は、早期または後期フュージョンを上回る性能を発揮できるか?
  • RQ21対1の対応関係がなく、密度が異なる高密度2次元画像特徴と低密度3次元LiDAR点群特徴を、どのように効果的にフュージョンできるか?
  • RQ3フュージョンプロセスに2次元画像の類似度を組み込むことで、オクルージョンを伴う複雑なシーンにおけるロバスト性が向上するか?
  • RQ4逆深度スケーリング(IDS)は、点群の空間的分布のバランスを改善することで、スパースなLiDAR点群における特徴学習を向上させられるか?
  • RQ5軽量でエンドツーエンドのモデルは、従来手法と比較して顕著に少ないパラメータで最先端の性能を達成できるか?

主な発見

  • CamLiFlow は KITTI Scene Flow ベンチマークで 4.43% のエンドツーエンド誤差を達成し、パラメータを 1/7 に削減しながらも、従来の最先端手法を上回った。
  • FlyingThings3D では、RAFT-3D と比較してエンドポイント誤差を 48.4% 減少させ、パラメータは 1/6 にまで削減した。
  • 2次元類似度測定値を統合したフュージョン対応補間の導入により、EPE 2D は 2.30 から 2.18 に低下し、ACC 1px は 83.3% から 84.5% に向上した。
  • 逆深度スケーリング(IDS)は、LiDARオンリーバリエーションで EPE 3D に 2.7%、ACC .05 に 2.7 パーセンテージポイントの向上をもたらし、点群バランス化の有効性を実証した。
  • 特徴抽出、コストボリューム、フローデコーディングの3段階すべてで特徴をフュージョンすることで最高の性能が得られ、早期/後期フュージョンや単一ステージフュージョンを上回った。
  • Tesla V100 GPU を用いた 960x540 画像では、推論時間が 118ms で、点群ブランチが最も処理時間が長かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。