Skip to main content
QUICK REVIEW

[論文レビュー] DyOb-SLAM : Dynamic Object Tracking SLAM System

Rushmian Annoy Wadud, Wei Sun|arXiv (Cornell University)|Nov 3, 2022
Robotics and Sensor-Based Localization被引用数 5
ひとこと要約

DyOb-SLAM は、マスク-RCNN を用いたセマンティックセグメンテーションと、密度のあるオプティカルフローを用いた動き推定を組み合わせることで、リアルタイムにカメラの局所化、静的環境のマップ作成、動的物体の追跡を同時に実行するビジュアルSLAMシステムである。VDO-SLAM よりも低い物体速度誤差を達成しており、エンドツーエンドのニューラルセグメンテーションと計算オーバーヘッドによるわずかな高いポーズ誤差があるものの、動的物体の速度推定性能が向上していることが示された。

ABSTRACT

Simultaneous Localization & Mapping (SLAM) is the process of building a mutual relationship between localization and mapping of the subject in its surrounding environment. With the help of different sensors, various types of SLAM systems have developed to deal with the problem of building the relationship between localization and mapping. A limitation in the SLAM process is the lack of consideration of dynamic objects in the mapping of the environment. We propose the Dynamic Object Tracking SLAM (DyOb-SLAM), which is a Visual SLAM system that can localize and map the surrounding dynamic objects in the environment as well as track the dynamic objects in each frame. With the help of a neural network and a dense optical flow algorithm, dynamic objects and static objects in an environment can be differentiated. DyOb-SLAM creates two separate maps for both static and dynamic contents. For the static features, a sparse map is obtained. For the dynamic contents, a trajectory global map is created as output. As a result, a frame to frame real-time based dynamic object tracking system is obtained. With the pose calculation of the dynamic objects and camera, DyOb-SLAM can estimate the speed of the dynamic objects with time. The performance of DyOb-SLAM is observed by comparing it with a similar Visual SLAM system, VDO-SLAM and the performance is measured by calculating the camera and object pose errors as well as the object speed error.

研究の動機と目的

  • 従来のSLAMシステムが静的環境を仮定し、動的物体を無視するという限界を是正すること。
  • 静的および動的要素を共有シーン内で同時に追跡・マッピングできるリアルタイムのビジュアルSLAMシステムの開発。
  • VDO-SLAM などの既存の動的認識型SLAMシステムと比較して、物体速度推定の精度を向上させること。
  • セマンティックセグメンテーションと動き推定をSLAMパイプラインに直接統合し、動的物体処理の耐障害性を高めること。

提案手法

  • 動的物体のインスタンスレベルのセマンティックセグメンテーションを可能にするために、マスク-RCNN を使用する。これにより、静的シーン要因との分離が可能になる。
  • 連続フレーム間での動的物体の動きベクトル推定に、密度のあるオプティカルフローおよびシーンフローアルゴリズムを採用する。
  • 2つの異なるマップを維持する:バンドル調整を用いた静的特徴のスパースマップと、動的物体のためのグローバルトラジェクトリーマップ。
  • ローカルマップの更新にはパーシャルバッチ最適化を、最終的なグローバルマップの精緻化にはフルバッチ最適化を適用する。
  • オブジェクトIDの割り当てとバウンディングボックスの追跡を実施し、フレームごとの動的物体のポーズおよび速度推定を可能にする。
  • 入力フレームをリアルタイムで処理し、検出されたオブジェクトに速度値と視覚的アノテーションをラベル付けして、出力フレームに表示する。

実験結果

リサーチクエスチョン

  • RQ1ビジュアルSLAMシステムは、正確なカメラローカライゼーションと静的マップ再構築を維持しながら、動的物体を効果的に区別・追跡できるか?
  • RQ2エンドツーエンドのセマンティックセグメンテーションとしてのマスク-RCNN は、SLAMにおける動的物体のポーズおよび速度推定精度にどのように影響するか?
  • RQ3SLAMパイプラインにマスク-RCNN などのディープラーニングモデルを統合する際の、計算コストと追跡精度のトレードオフは何か?
  • RQ4特に深度の曇りや遮蔽状況下において、DyOb-SLAM は VDO-SLAM と比較して物体速度推定誤差でどの程度優れているか?
  • RQ5ニューラルネットワークベースのセグメンテーションは、現実の動的環境における動的物体追跡をどの程度向上させるか?

主な発見

  • DyOb-SLAM は VDO-SLAM よりもわずかに高い平均カメラおよび物体ポーズ誤差を示しており、並進誤差の差は 0.003–0.005、回転誤差の差は 0.007–0.017 である。
  • 物体ポーズ誤差は並進差が 0.009–0.03、回転差が 0.05–0.17 であり、最初のイテレーションでは以降のイテレーションよりも高い誤差を示している。
  • ポーズ誤差がやや高いにもかかわらず、DyOb-SLAM は顕著に低い物体速度誤差を達成しており、VDO-SLAM よりも 0.96–1.20 の範囲で優れている。これは、速度推定性能が優れていることを示している。
  • システムの性能は、近接する動的物体における深度の曇りに影響を受ける。重複する深度値により、セグメンテーションと追跡の誤りが生じる。
  • マスク-RCNN の統合により、VDO-SLAM が事前処理済みの真値セグメンテーションに依存するのと比較して、計算コストが増加している。
  • 物体速度はフレームごとに計算され、バウンディングボックスとともに表示されるが、深度スケールを逸脱すると追跡が失敗し、継続的な速度測定が制限される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。