Skip to main content
QUICK REVIEW

[論文レビュー] FlowNet3D: Learning Scene Flow in 3D Point Clouds

Xingyu Liu, Charles R. Qi|arXiv (Cornell University)|Jun 4, 2018
Advanced Vision and Imaging参考文献 38被引用数 22
ひとこと要約

FlowNet3D は、動きの表現を学習し、特徴を伝搬するための新しいフローエンベッディング層とセットアップコンボリューション層を用いて、エンドツーエンドの方法で生の点群から直接3次元シーンフローベクトルを推定する深層学習アーキテクチャである。合成データであるFlyingThings3Dのみで学習させたにもかかわらず、実世界のKITTI LiDARスキャンへも強固に一般化し、非ディープラーニングベースラインを上回り、最先端の手法と同等の結果を達成した。

ABSTRACT

Many applications in robotics and human-computer interaction can benefit from understanding 3D motion of points in a dynamic environment, widely noted as scene flow. While most previous methods focus on stereo and RGB-D images as input, few try to estimate scene flow directly from point clouds. In this work, we propose a novel deep neural network named $FlowNet3D$ that learns scene flow from point clouds in an end-to-end fashion. Our network simultaneously learns deep hierarchical features of point clouds and flow embeddings that represent point motions, supported by two newly proposed learning layers for point sets. We evaluate the network on both challenging synthetic data from FlyingThings3D and real Lidar scans from KITTI. Trained on synthetic data only, our network successfully generalizes to real scans, outperforming various baselines and showing competitive results to the prior art. We also demonstrate two applications of our scene flow output (scan registration and motion segmentation) to show its potential wide use cases.

研究の動機と目的

  • 2次元画像表現を経由せずに、点群から直接エンドツーエンドで3次元シーンフローベクトルを推定することを可能にすること。
  • ステレオやRGB-Dデータに依存せずに、生の点群入力を扱えるディープラーニングベースの3次元シーンフローベクトル推定手法の不足を補うこと。
  • 時系列にわたる点群間の空間的・幾何的関係を効果的にモデル化できる学習可能なレイヤーを設計すること。
  • 合成データで学習したモデルが、実世界のLiDARスキャンへ一般化できることを示し、実データのアノテーションに依存するのを減らすこと。
  • スキャンアライメントやモーショングラセグメンテーションなどの上流タスクにおけるシーンフローの有効性を検証すること。

提案手法

  • 2つの連続する点群間の点を幾何的・空間的類似性の集約によって関連付けることで、動き符号化に適した新しいフローエンベッディングレイヤーを提案する。
  • 空間的および特徴ベースのアテンションを用いて、1つの点集合から別の点集合へ特徴を学習的に伝搬するセットアップコンボリューションレイヤーを導入し、情報に基づいたアップサンプリングを可能にする。
  • PointNet++バックボーンを変更し、共通のエンコーダ・デコーダアーキテクチャ内で、階層的特徴と動き埋め込みを同時に抽出する。
  • 局所的およびグローバルなコンテキストを捉えるために、マルチスケール特徴集約戦略を採用し、正確なフローベクトル予測を実現する。
  • 2ストリームエンコーダーを用いて、2つの連続フレームの入力点群を処理し、1番目のフレームの各点に対して密な3次元フローベクトルを出力する。
  • セットアップコンボリューションレイヤーを用いた反復的リファインメントにより、フローベクトル予測を改善するための学習可能なリファインメントヘッドを適用する。

実験結果

リサーチクエスチョン

  • RQ1ディープニューラルネットワークは、2次元画像入力に依存せずに、生の3次元点群からエンドツーエンドで3次元シーンフローベクトルを推定できるか?
  • RQ2合成データのみで学習したモデルは、微調整なしに実LiDARスキャンへ効果的に一般化できるか?
  • RQ3提案されたフローエンベッディングレイヤーとセットアップコンボリューションレイヤーは、標準的な補間法や手作業特徴と比較して、どのように動き推定を向上させるか?
  • RQ4FlowNet3Dが推定するシーンフローは、スキャンアライメントやモーションセグメンテーションといった上流タスクに強力な信号を提供できるか?
  • RQ5FlowNet3Dの性能は、合成データおよび実世界ベンチマークにおいて、先行研究と比較してどの程度か?

主な発見

  • FlyingThings3Dの合成ベンチマークにおいて、FlowNet3Dは先行研究の最良手法[31]と比較して、3次元エンドポイント誤差を63%も低減した。
  • KITTIの実LiDARベンチマークでは、ICPなどの非ディープラーニングベースラインを上回り、特に実データで微調整した後は、先行研究と同等の結果を達成した。
  • 合成データでのみ学習させた状態でも、FlowNet3Dは実スキャンへ強固に一般化し、優れたゼロショット一般化能力を示した。
  • KITTIの100フレームで微調整した後、テストセットにおけるワーピング誤差EPEが0.125にまで低下し、ICPやシーンフロー専用のベースラインを上回る最良の性能を達成した。
  • モデルは、局所的最適解に陥る可能性があるICPに比べて、部分的なスキャンアライメントを安定して実行でき、定量的・定性的な結果でその有効性を示した。
  • FlowNet3Dのシーンフローアウトプットを用いたモーションセグメンテーションは、車両、歩行者、静止物体を明確に分離でき、意味的モーション理解への有用性を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。