Skip to main content
QUICK REVIEW

[論文レビュー] ClusterVO: Clustering Moving Instances and Estimating Visual Odometry for Self and Surroundings

Jiahui Huang, Sheng Yang|arXiv (Cornell University)|Mar 29, 2020
Video Surveillance and Tracking Methods参考文献 47被引用数 4
ひとこと要約

ClusterVOは、幾何的またはオブジェクト固有の事前知識に依存せずに、動的シーンにおける自己移動量と動く剛体物体のクラスタリングを同時に推定するリアルタイムステレオビジョウスオドメトリーシステムを提案する。マルチレベル確率的関連付けと、セマンティック、空間的、運動的ヒントを統合する非均質なCRFを用い、オンラインクラスタリングとスライディングウィンドウ最適化を可能にし、KITTIおよびOxford Multimotionデータセットで最先端の性能を達成し、8 FPSで動作し、高い精度を発揮する。

ABSTRACT

We present ClusterVO, a stereo Visual Odometry which simultaneously clusters and estimates the motion of both ego and surrounding rigid clusters/objects. Unlike previous solutions relying on batch input or imposing priors on scene structure or dynamic object models, ClusterVO is online, general and thus can be used in various scenarios including indoor scene understanding and autonomous driving. At the core of our system lies a multi-level probabilistic association mechanism and a heterogeneous Conditional Random Field (CRF) clustering approach combining semantic, spatial and motion information to jointly infer cluster segmentations online for every frame. The poses of camera and dynamic objects are instantly solved through a sliding-window optimization. Our system is evaluated on Oxford Multimotion and KITTI dataset both quantitatively and qualitatively, reaching comparable results to state-of-the-art solutions on both odometry and dynamic trajectory recovery.

研究の動機と目的

  • 動的シーンにおける自己移動量の推定と複数の動く剛体物体の追跡を同時に実行する汎用的でリアルタイムなビジョウスオドメトリーシステムの開発を目的とする。
  • 従来の手法がバッチ処理やシーンの事前知識、または物体の形状や構造に関する特殊な仮定に依存するという限界を克服することを目的とする。
  • 屋内および屋外の両環境、特に自動運転やARアプリケーションを含む状況において、動的物体とカメラの運動の正確で一貫性のあるクラスタリングを実現することを目的とする。
  • 密度の高いRGB-D入力や事前に定義されたオブジェクトテンプレートを必要としない、高効率かつ頑健なオンラインシステムの設計を目的とする。

提案手法

  • マルチレベルの確率的関連付け機構が、運動の一貫性と空間的近接性を用いて、2D検出結果と3Dランドマークをフレーム間で追跡する。
  • 非均質な条件付きランダムフィールド(CRF)が、セマンティックバウンディングボックス、空間的類似性、運動的一致性を統合し、リアルタイムでクラスタセグメンテーションを共同推定する。
  • スライディングウィンドウ最適化フレームワークを採用し、カメラポーズと動的物体の軌道を同時に最適化する。
  • CRFの定式化は、単一項および二重項の潜在変数を含み、セマンティック信頼度、空間的クラスタリング、運動的一致性(式5)の項を含む。
  • 物体サイズの事前知識やシーン構造の仮定に依存しないため、多様な環境への一般化が可能である。
  • 本システムは、KITTIおよびOxford Multimotionデータセットのステレオシーケンスを用いて訓練および評価され、スパース特徴と2D検出結果のみを入力として使用する。

実験結果

リサーチクエスチョン

  • RQ1シーン固有の事前知識に依存しない汎用的ビジョウスオドメトリーシステムは、自己移動量と動的物体の追跡を正確に実現できるか?
  • RQ2スパース2D検出結果と3Dランドマークのみを用いて、オンラインで動く剛体物体のクラスタリングをどのようにして頑健に実現できるか?
  • RQ3非均質なCRFにおいて、セマンティック、空間的、運動的ヒントを統合することで、動的シーン理解にどのような影響を与えるか?
  • RQ4リアルタイムシステムは、オドメトリと動的軌道回復の両面で、バッチ最適化または専用手法と同等の性能を達成できるか?

主な発見

  • ClusterVOはKITTIデータセットで8 FPSを達成し、Chenら(1.2秒/フレーム)を著しく上回り、DynSLAMと同等の効率性を示している。
  • KITTIデータセットにおいて、ClusterVOは自己移動量の推定で並進誤差0.52 m(ATE)および回転誤差0.19 rad(RPE)を達成し、最先端の手法と同等の性能を示している。
  • 動的物体追跡の分野では、KITTIの「Moderate」カテゴリで49.65%のAP(平均精度)を達成し、DynSLAM(47.16%)を上回り、検出漏れに対しても頑健であることが示された。
  • アブレーションスタディの結果、CRFに3D幾何的およびセマンティックヒントを追加することで、2DのみのCRFと比較してクラスタ運動のATEが45.8%低減した。これは、マルチモodal融合の有効性を示している。
  • Oxford Multimotionデータセットでも競争力ある結果を達成し、自己移動量のATEは0.61 m、クラスタ運動のATEは0.13 mを記録。バッチ最適化されたClusterSLAMに匹敵する性能をオンライン処理で達成した。
  • 可視化結果から、非均質なCRFが誤分類されたランドマークを効果的にフィルタリングし、クラスタリングの一貫性と軌道推定の精度を向上させていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。