Skip to main content
QUICK REVIEW

[論文レビュー] Self-Supervised 3D Scene Flow Estimation Guided by Superpoints

Yaqi Shen, Le Hui|arXiv (Cornell University)|May 4, 2023
Advanced Vision and Imaging被引用数 4
ひとこと要約

本稿では、予測されたフローに従って動的スーパポイントを段階的に生成することで、動き推定の精度を向上させるエンドツーエンドの自己教師付き3次元シーンフロー推定フレームワーク、SPFlowNetを提案する。微分可能クラスタリング機構とGRUベースのリファインメントを用いて、フローマップに従うスーパポイント生成とスーパポイントに従うフローのリファインメントを同時に最適化することで、FlyingChairs、KITTI、ScanNetベンチマークで最先端の性能を達成し、KITTIにおけるARで最大9.92%の向上を達成した。

ABSTRACT

3D scene flow estimation aims to estimate point-wise motions between two consecutive frames of point clouds. Superpoints, i.e., points with similar geometric features, are usually employed to capture similar motions of local regions in 3D scenes for scene flow estimation. However, in existing methods, superpoints are generated with the offline clustering methods, which cannot characterize local regions with similar motions for complex 3D scenes well, leading to inaccurate scene flow estimation. To this end, we propose an iterative end-to-end superpoint based scene flow estimation framework, where the superpoints can be dynamically updated to guide the point-level flow prediction. Specifically, our framework consists of a flow guided superpoint generation module and a superpoint guided flow refinement module. In our superpoint generation module, we utilize the bidirectional flow information at the previous iteration to obtain the matching points of points and superpoint centers for soft point-to-superpoint association construction, in which the superpoints are generated for pairwise point clouds. With the generated superpoints, we first reconstruct the flow for each point by adaptively aggregating the superpoint-level flow, and then encode the consistency between the reconstructed flow of pairwise point clouds. Finally, we feed the consistency encoding along with the reconstructed flow into GRU to refine point-level flow. Extensive experiments on several different datasets show that our method can achieve promising performance.

研究の動機と目的

  • 従来の3次元シーンフロー手法における固定でオフラインのスーパポイントの限界を解決する。これは、剛性クラスタリングにより、異なる動きを持つ点がグループ化されがちなことが原因である。
  • 複雑な3次元シーンにおける実際の動きパターンを反映する、動的でフローに適応するスーパポイントを学習することで、シーンフロー推定の精度を向上させる。
  • スーパポイント生成とフローリファインメントを統合した、エンドツーエンドで自己教師付きのフレームワークを構築し、同時に最適化する。
  • 不正確なスーパポイントによる誤差伝搬を低減するため、フローパredした関連付けを用いてオンラインでのスーパポイント更新をガイドする。
  • 真のフローサポートを必要としない状態で、合成および実世界のLiDARデータセットにおいて最先端の性能を示す。

提案手法

  • フレームワークは、座標、フロー、特徴量を含むスーパポイント中心点を、最も遠い点抽出(FPS)によって初期化する。
  • フローに従うスーパポイント生成モジュールは、前回の反復で得られた双方向フローパレット予測を用いて、ソフトな点からスーパポイントへの関連付けを構築する。
  • 関連付けマップを学習することで、関連する点の特徴量、座標、フロー値を適応的に集約し、スーパポイント中心点を更新する。
  • 同じ関連付けマップを用いて、スーパポイントレベルのフローを集約することで、点レベルのフローを再構築する。
  • 一貫性符号化層は、入力点群とターゲット点群の再構築フロー間の整合性を測定し、動きの一貫性を強制する。
  • GRUベースのリファインメントモジュールは、再構築フローと一貫性符号化を統合し、最終的な点単位のフローパレット予測をリファインメントする。

実験結果

リサーチクエスチョン

  • RQ1固定でオフラインのクラスタリングと比較して、オンラインでフローに従うスーパポイント生成は、3次元シーンフロー推定の精度を向上させるか?
  • RQ2動的スーパポイントをエンドツーエンド学習フレームワークに統合することで、実世界および合成データセットにおける性能にどのような影響を与えるか?
  • RQ3スーパポイントの一貫性符号化および一貫性損失は、フローリファインメントの質にどのような影響を与えるか?
  • RQ4スーパポイント数(L)、近傍サイズ(K)、反復回数(T)といったハイパーパrameterは、モデルの性能にどのように影響するか?
  • RQ5真のフローサポートを一切必要としない自己教師付きフレームワークは、KITTIおよびFlyingChairsで最先端の結果を達成できるか?

主な発見

  • SPFlowNetはKITTI-tデータセットで平均リcall(AR)79.65%を達成し、先行手法と比較してARで最大9.92%の向上を示した。
  • KITTI-rではエンドツーエンドの自己教師付きEPEが0.089にまで低下し、真のフローサポートなしで強力な一般化性能を示した。
  • アブレーションスタディの結果、スーパポイント生成モジュールや一貫性符号化を削除すると性能が著しく低下し、ARはそれぞれ6.8%および6.3%低下した。
  • 最適な設定はL=30、K=2近傍中心点、T=3反復であり、精度と推論効率のバランスが取れている。
  • 真のスーパポイントが存在しない状況では、フローに従うスーパポイント生成モジュールがSPNetベースの生成法を上回り、フローのガイドが極めて重要であることを実証した。
  • 一貫性損失は不可欠である。この損失を削除するとEPEが0.008上昇し、ARが2.4%低下した。これは、動きの一貫性を強制する役割を果たしていることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。