Skip to main content
QUICK REVIEW

[論文レビュー] Towards Better Generalization: Joint Depth-Pose Learning without PoseNet

Wang Zhao, Shaohui Liu|arXiv (Cornell University)|Apr 3, 2020
Advanced Vision and Imaging参考文献 66被引用数 8
ひとこと要約

本論文は、PoseNetに代えて光流に基づく相対姿勢推定と微分可能な2視点トリアングレーションを用いることでスケール不一致を解消し、スケールに依存しない3次元構造回復を実現する自己教師付き連合深度-姿勢学習フレームワークを提案する。本手法は深度スケールをトリアングレートされた点群と明示的に整合させることで、エンドツーエンド学習を可能にし、KITTI、NYUv2、TUM-RGBDデータセットにおいて、特に長時間シーケンスやテクスチャレスな領域といった困難な条件下でも最先端の性能と優れた一般化性能を達成する。

ABSTRACT

In this work, we tackle the essential problem of scale inconsistency for self-supervised joint depth-pose learning. Most existing methods assume that a consistent scale of depth and pose can be learned across all input samples, which makes the learning problem harder, resulting in degraded performance and limited generalization in indoor environments and long-sequence visual odometry application. To address this issue, we propose a novel system that explicitly disentangles scale from the network estimation. Instead of relying on PoseNet architecture, our method recovers relative pose by directly solving fundamental matrix from dense optical flow correspondence and makes use of a two-view triangulation module to recover an up-to-scale 3D structure. Then, we align the scale of the depth prediction with the triangulated point cloud and use the transformed depth map for depth error computation and dense reprojection check. Our whole system can be jointly trained end-to-end. Extensive experiments show that our system not only reaches state-of-the-art performance on KITTI depth and flow estimation, but also significantly improves the generalization ability of existing self-supervised depth-pose learning methods under a variety of challenging scenarios, and achieves state-of-the-art results among self-supervised learning-based methods on KITTI Odometry and NYUv2 dataset. Furthermore, we present some interesting findings on the limitation of PoseNet-based relative pose estimation methods in terms of generalization ability. Code is available at https://github.com/B1ueber2y/TrianFlow.

研究の動機と目的

  • 自己教師付き連合深度-姿勢学習におけるスケール不一致問題に取り組み、特に長時間シーケンスや屋内環境下での性能と一般化性能に制限が生じるのを防ぐ。
  • 困難なカメラ運動や視覚的条件下でも一般化性能に限界を示すPoseNetベースの手法の課題を克服する。
  • 2視点幾何と微分可能なトリアングレーションを活用することで、スケールをネットワーク推定から明示的に分離するシステムを構築する。
  • エンドツーエンドでスケールに配慮した学習を実現することで、単眼深度およびビジュアルオドメトリのタスクにおけるロバスト性と精度を向上させる。

提案手法

  • 密度的な光流対応から基本行列を計算する直接的な相対姿勢推定モジュールにより、PoseNetアーキテクチャを置き換える。
  • 2連続フレームからのスケールに依存しない3次元点群を回復するための微分可能な2視点トリアングレーションモジュールを導入する。
  • 学習可能なスケール変換を用いて予測された深度マップのスケールをトリアングレートされた3次元構造と整合させる。
  • エンドツーエンド学習中に、整合された深度マップを用いて深度誤差の計算と密な再投影一貫性のチェックを実行する。
  • 自己教師付きの監視を伴わず、光度的一致性と幾何的制約を併用して深度と光流の予測を同時に監視する。
  • 光流、トリアングレーション、深度監視を1つの学習プロセスに統合した、統一的で微分可能なパイプラインを採用する。

実験結果

リサーチクエスチョン

  • RQ1PoseNetを光流に基づく相対姿勢推定に置き換えることで、自己教師付き深度-姿勢学習における一般化性能が向上するか?
  • RQ2深度とトリアングレートされた3次元構造の間で明示的なスケール整合を図ることで、性能とロバスト性にどのような影響を与えるか?
  • RQ3長時間シーケンスやテクスチャレスな領域といった困難なビジュアルオドメトリのシナリオにおいて、本手法はPoseNetベースのベースラインより優れた一般化性能を示すか?
  • RQ4PoseNetベースの相対姿勢推定の一般化性能とロバスト性に限界があるとすれば、その主な要因は何か?
  • RQ5微分可能な2視点トリアングレーションモジュールは、エンドツーエンド自己教師付き深度および姿勢学習を効果的に支援できるか?

主な発見

  • 本手法は、KITTIの深度および光流推定ベンチマークで最先端の性能を達成し、既存の自己教師付き手法を上回る。
  • NYUv2データセットでは、相対誤差(rel)が0.189、log10が0.079を達成し、PoseNetベースのベースラインと比べて顕著な一般化性能の向上を示した。
  • KITTIシーケンス09および10における長時間オドメトリにおいて、大規模なカメラ運動(ストライド=3)下でも、PoseNetベースの手法が失敗する状況でも、本手法はロバストなトラジェクトリ推定を維持した。
  • TUM-RGBDデータセットにおいて、本手法はテクスチャレスな領域、複雑な運動、照明変化に対しても良好に一般化し、PoseNetベースラインおよびORB-SLAM2を上回った。
  • アブレーションスタディの結果、光流に基づく姿勢推定と明示的なスケール整合の両方が、一般化性能の向上に不可欠であることが確認され、フルシステムではNYUv2におけるδ < 1.25の精度が0.701に達した。
  • 本手法は、屋内環境や高速なエゴモーションが発生する実世界のシナリオにおいて、従来の自己教師付き手法が著しく性能を低下させる状況でも、優れたロバスト性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。