Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Monocular Depth and Ego-motion Learning with Structure and Semantics

Vincent Casser, Sören Pirk|arXiv (Cornell University)|Jun 12, 2019
Advanced Vision and Imaging被引用数 22
ひとこと要約

本稿では、個々の物体の3次元運動をSE3変換を用いてモデル化し、セマンティックインスタンスマスクを統合することで、非教師ありモノクロナルな同時深度推定と自己移動量推定の手法を提案する。構造と意味論を微分可能ワーピングフレームワークに統合し、オンラインリファインメントを適用することで、KITTIおよびCityscapesで最先端の性能を達成した。特に、顕著な運動を示す動的シーンにおいて、深度および自己移動量の指標で、先行手法を大きく上回った。

ABSTRACT

We present an approach which takes advantage of both structure and semantics for unsupervised monocular learning of depth and ego-motion. More specifically, we model the motion of individual objects and learn their 3D motion vector jointly with depth and ego-motion. We obtain more accurate results, especially for challenging dynamic scenes not addressed by previous approaches. This is an extended version of Casser et al. [AAAI'19]. Code and models have been open sourced at https://sites.google.com/corp/view/struct2depth.

研究の動機と目的

  • 物体の運動がモデル化されていない動的シーンにおいて、非教師ありモノクロナルな深度推定と自己移動量推定の課題に対処すること。
  • 個々の物体の3次元運動をSE3変換を用いて明示的にモデル化することで、深度および自己移動量予測の精度を向上させること。
  • 微調整なしにリアルタイムでモデルを適応させるオンラインリファインメント技術を用いて、データセット間でのドメイン一般化と転移学習を可能にすること。
  • 構造的幾何(3次元シーン再構築)と意味論的情報(オブジェクトインスタンスマスク)を学習プロセスに統合し、より良いシーン理解を実現すること。

提案手法

  • 本手法は、単一のRGB画像から密度の高い深度マップを予測するため、完全畳み込み型エンコーダ・デコーダネットワークを用いる。
  • 自己移動量を予測するための別個のエゴモーションネットワークを採用し、連続するフレーム間の6次元SE3変換(並進と回転)を推定する。
  • オブジェクトの運動は、予測された深度マップにSE3変換を適用することでモデル化され、インスタンスマスクを用いて個々のオブジェクトの3次元運動推定が可能になる。
  • 微分可能画像ワーピング演算子を用いて、エゴモーションと深度を用いてソース画像をワープし、ターゲットフレームを再構築する。この際、オブジェクトマスクを用いて移動領域を分離する。
  • 推論中にオンラインリファインメント技術を適用し、ターゲットドメインの数フレームを用いて予測を精緻化することで、モデルを新しい環境に適応させる。
  • 損失関数は、ワープされた画像と元のターゲットフレーム間の光度的一致性に基づいて計算され、移動オブジェクトおよび無効領域はマスク処理により除外される。

実験結果

リサーチクエスチョン

  • RQ13次元空間における個々のオブジェクト運動の明示的モデル化は、動的シーンにおける非教師ありモノクロナル深度推定と自己移動量推定の性能向上に寄与するか?
  • RQ2セマンティックインスタンスマスクと3次元運動制約を統合することで、高運動コンテンツを有する困難なデータセット上での性能にどのような影響を与えるか?
  • RQ3微調整なしに、オンラインリファインメントが新しいデータセットでテストする際のドメイン転送性能をどの程度向上させるか?
  • RQ4オブジェクト運動モデル化とオンラインリファインメントを組み合わせることで、単体の各コンponentよりも相乗効果が得られるか?
  • RQ5KITTIやCityscapesのようなベンチマークにおいて、本手法は最先端の非教師あり手法と比較して、動的シーンへのロバストネスの観点からどのように優れているか?

主な発見

  • 提案手法はKITTIデータセットで新たな最先端性能を達成し、運動モデル化(M)とオンラインリファインメント(R)を併用した場合、絶対相対誤差(Abs Rel)を0.1052まで低下させた。これはベースラインの0.1563に比べて顕著な改善である。
  • 非常に動的であるとされるCityscapesデータセットでは、先行する非教師あり手法を著しく上回り、複雑で現実世界に近い環境でも有効性を示した。
  • 運動モデル化(M)とオンラインリファインメント(R)の組み合わせにより、RMSEは50mキャップで3.5591、80mキャップで4.7619にまで低下し、キーメトリクスで10%以上の改善が達成された。
  • オンラインリファインメント単体でも、特にKITTIにおいて性能が向上し、Abs Relを0.1388から0.1175に低下させた。これは強力なドメイン適応能力を示している。
  • 運動モデル化単体でも、両データセットで性能向上が見られ、特にCityscapesではAbs Relを0.1388から0.1377に低下させた。動的シーンの処理における価値が裏付けられた。
  • 改訂版KITTI評価コードを用いた評価でも、同評価設定を用いた先行手法をすべて上回り、ロバストネスと一般化性能の高さが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。