Skip to main content
QUICK REVIEW

[論文レビュー] D$^3$FlowSLAM: Self-Supervised Dynamic SLAM with Flow Motion Decomposition and DINO Guidance

Xingyuan Yu, Weicai Ye|arXiv (Cornell University)|Jul 18, 2022
Advanced Vision and Imaging被引用数 11
ひとこと要約

本稿では、二重フロー表現を用いて光流を静的(カメラの運動)および動的(物体の運動)成分に分解する自己教師付き動的SLAMシステムDeFlowSLAMを提案する。マスク集約(Mask-Agg)を用いたオクルージョン対応ワープと自己教師付き最適化を統合した動的アップデートモジュールにより、DeFlowSLAMはDROID-SLAMに比べて動的環境において優れた性能を発揮する一方で、静的環境でも競争力のある正確性を維持する。

ABSTRACT

In this paper, we introduce a self-supervised deep SLAM method that robustly operates in dynamic scenes while accurately identifying dynamic components. Our method leverages a dual-flow representation for static flow and dynamic flow, facilitating effective scene decomposition in dynamic environments. We propose a dynamic update module based on this representation and develop a dense SLAM system that excels in dynamic scenarios. In addition, we design a self-supervised training scheme using DINO as a prior, enabling label-free training. Our method achieves superior accuracy compared to other self-supervised methods. It also matches or even surpasses the performance of existing supervised methods in some cases. All code and data will be made publicly available upon acceptance.

研究の動機と目的

  • 単眼高密度SLAMにおける動的物体の干渉がポーズ推定とマップ精度を低下させるという課題に対処すること。
  • 動的ピxlsを無視するか、Mask R-CNNのような高負荷な検出モデルに依存する既存のSLAMシステムの限界を克服すること。
  • ポーズ、深度、光流の真値ラベルを一切必要としない自己教師付き学習フレームワークを構築し、動的SLAMシステムを訓練すること。
  • 静的および動的運動成分を別々に明示的にモデル化することで、動的シーンにおけるカメラポーズおよび深度推定の堅牢性を向上させること。
  • 静的および極めて動的環境の両方で高い性能を発揮し、動的な物体を含む実世界のARアプリケーションに対しても対応すること。

提案手法

  • 人間の視覚認識を模倣するように、カメラの運動によって引き起こされる静的フローフィールドと物体の運動によって引き起こされる動的フローフィールドに光流を分解する二重フロー表現を導入する。
  • 現在フレームから隣接フレームへの画像ワープを用いて、静的および動的フローフィールドを推定し、合計フローはそれらの和として表す。
  • オクルージョンに起因する誤ったアライメントを低減するために、ConvGRUを用いて反復的に動的マスクを精緻化する動的アップデートモジュールを設計する。
  • 精緻化された動的マスクと推定された重みを、自己教師付きの方法でカメラポーズ、逆深度、およびフローレジデュアルを同時に最適化するための密なバンドル調整(DBA)層に統合する。
  • 自己教師付き学習の目的関数において、特徴マッチングと一貫性の向上のため、DINO特徴を統合する。
  • 真値ラベルを一切必要としない、光度的一致性損失を用いたエンドツーエンドの自己教師付き学習により、システム全体を訓練する。

実験結果

リサーチクエスチョン

  • RQ1標準的なフロー推定と比較して、光流の二重フロー表現は動的シーンにおけるSLAMの堅牢性を向上させるか?
  • RQ2真値ラベルが利用できない状況下で、自己教師付き学習パラダイムは動的高密度SLAMにどの程度有効か?
  • RQ3動的運動の分解とオクルージョン対応マスク精緻化は、極めて動的環境下でのドリフト低減とポーズ精度向上に寄与するか?
  • RQ4SOTA(最先端)SLAMシステムと比較して、DeFlowSLAMは静的、動的、および挑戦的なARシナリオのすべてにどの程度一般化可能か?
  • RQ5追加の訓練なしで、二重フロー表現を効果的に運動セグメンテーションに再利用可能か?

主な発見

  • 単眼設定下でEuRoCデータセットにおいてDeFlowSLAMは平均ATE 0.136mを達成し、大多数の教師あり手法を上回り、優れた一般化性能を示している。
  • TUM-RGBDの静的シーケンスでは、DeFlowSLAMは平均ATE 0.114mを達成し、SOTAのDROID-SLAMを上回っている。
  • 極めて動的であるKITTIシーケンス09では、DeFlowSLAMはDROID-SLAMが著しいドリフトを示す中で顕著に優れた性能を発揮し、動的環境下での堅牢性を確認している。
  • Virtual KITTI2データセットでは、DeFlowSLAMは運動セグメンテーションのmIoUスコアとしてVK01で0.538585、VK02で0.528356、VK18で最大0.739282を達成し、強力な運動セグメンテーション能力を示している。
  • ステレオSLAMにおいて、DeFlowSLAMはTartanAirステレオテストセットで平均ATE 1.02mを達成し、TartanVOを上回り、DROID-SLAMと同等の性能を発揮している。
  • ARアプリケーションでは、DeFlowSLAMは動的な干渉要因が存在する中でもカメラのトラッキングと仮想オブジェクトの安定レンダリングを成功させたが、DROID-SLAMは顕著なドリフトを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。