Skip to main content
QUICK REVIEW

[論文レビュー] Self-Point-Flow: Self-Supervised Scene Flow Estimation from Point Clouds with Optimal Transport and Random Walk

Ruibo Li, Guosheng Lin|arXiv (Cornell University)|May 18, 2021
Advanced Vision and Imaging参考文献 40被引用数 5
ひとこと要約

本稿では、最適輸送を用いたマルチモーダルな対応関係マッチングとランダムウォークを用いた疑似ラベルの精練により、3次元点群からの自己教師あり3次元シーンフロー推定のためのSelf-Point-Flowを提案する。3次元座標、色、表面法線を質量等価制約付きの最適輸送フレームワークに統合し、グラフベースのランダムウォークによる局所的整合性の強制により、アノテーションなしでFlyingThings3DおよびKITTIで最先端の性能を達成した。一部のケースでは、真値ラベルを一切使用しないにもかかわらず、教師ありベースラインを上回った。

ABSTRACT

Due to the scarcity of annotated scene flow data, self-supervised scene flow learning in point clouds has attracted increasing attention. In the self-supervised manner, establishing correspondences between two point clouds to approximate scene flow is an effective approach. Previous methods often obtain correspondences by applying point-wise matching that only takes the distance on 3D point coordinates into account, introducing two critical issues: (1) it overlooks other discriminative measures, such as color and surface normal, which often bring fruitful clues for accurate matching; and (2) it often generates sub-par performance, as the matching is operated in an unconstrained situation, where multiple points can be ended up with the same corresponding point. To address the issues, we formulate this matching task as an optimal transport problem. The output optimal assignment matrix can be utilized to guide the generation of pseudo ground truth. In this optimal transport, we design the transport cost by considering multiple descriptors and encourage one-to-one matching by mass equality constraints. Also, constructing a graph on the points, a random walk module is introduced to encourage the local consistency of the pseudo labels. Comprehensive experiments on FlyingThings3D and KITTI show that our method achieves state-of-the-art performance among self-supervised learning methods. Our self-supervised method even performs on par with some supervised learning approaches, although we do not need any ground truth flow for training.

研究の動機と目的

  • 現実世界の3次元点群におけるアノテート済みシーンフローデータの不足に応えるため、自己教師あり学習を可能にする。
  • 点同士の対応関係を単一の3次元座標に依存する従来の自己教師あり手法の限界を克服し、不正確で一貫性のない対応関係を回避する。
  • 3次元座標、色、表面法線といった複数の記述子を制約付き最適輸送定式化に統合することで、対応関係マッチングを改善する。
  • グラフベースのランダムウォークモジュールにより局所的整合性を強制することで、疑似ラベルの品質を向上させ、動き予測の局所的整合性を確保する。
  • トレーニング中に真値フローラベルを一切使用しないにもかかわらず、教師あり手法と同等の性能を達成する。

提案手法

  • 3次元座標、表面法線、色特徴から導出されるコスト行列を用いて、点対応関係マッチングを最適輸送問題として定式化する。
  • 最適輸送定式化において質量等価制約を課して1対1のマッチングを強制し、多数対1の割り当てを防ぐ。
  • 有効な対応関係から座標差分を計算することで、疑似真値フローベクトルを生成する。
  • 各点をノードとする点群上にグラフを構築し、3次元距離を用いてエッジ重みを定義して局所的類似性を符号化する。
  • 無向グラフ上でランダムウォークを適用し、疑似ラベルを伝搬・平滑化することで、動き予測の局所的整合性を確保する。
  • 有向部分グラフを用いて反復的なラベル伝搬により未ラベル点のラベルを精錬し、耐性と完全性を向上させる。

実験結果

リサーチクエスチョン

  • RQ13次元座標に加え、色と法線といったマルチモーダル特徴を用いた最適輸送は、座標のみの最近傍探索に比べ、自己教師あり点対応関係マッチングの正確性を向上させるか?
  • RQ2最適輸送における質量等価制約の強制は、より良い1対1マッチングを実現し、シーンフロー推定における退化解を低減するか?
  • RQ3グラフベースのランダムウォークによる精錬は、自己教師ありシーンフロー学習における疑似ラベルの局所的整合性と全体的な品質をどの程度向上させるか?
  • RQ4最適輸送とランダムウォークの統合は、標準ベンチマークにおいて、従来の自己教師ありまたは教師ありシーンフロー手法と比較してどのように差をつけるか?
  • RQ5真値フローをトレーニング時に一切使用しない自己教師あり手法が、教師あり手法と同等の性能を達成できるか?

主な発見

  • 3次元座標、色、法線というマルチモーダル特徴と質量等価制約を備えた提案された最適輸送モジュールにより、FlyingThings3Dデータセットにおける平均スコア(AS)が24.36に向上し、ベースライン手法に比べ顕著な向上を示した。
  • 最適輸送コストに色と表面法線特徴を追加することで、ASは10.19から24.36に上昇し、対応関係マッチングにおけるマルチモーダルな手がかりの重要性を実証した。
  • ランダムウォークに基づく疑似ラベル精錬モジュールにより、ASは24.36から41.74に向上し、局所的整合性の精錬が高品質な疑似ラベルに不可欠であることを示した。
  • アブレーションスタディの結果、無向部分グラフランダムウォーク(UG)は、単純な平滑化ユニット(NS)よりも大きな向上(24.36から40.88)を示し、構造的ラベル伝搬の有効性を裏付けた。
  • FlyingThings3DではASが41.74に達し、KITTIでも競争力のある性能を示した。真値フローを一切使用しなかったにもかかわらず、他の自己教師あり手法を上回り、教師ありベースラインに近づいた。
  • 2,048点の点群における疑似ラベル生成および精錬に要する合計時間は、1枚の2080Ti GPUで78.8msであり、リアルタイム応用において実用的な効率性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。