Skip to main content
QUICK REVIEW

[論文レビュー] Attentional Separation-and-Aggregation Network for Self-supervised Depth-Pose Learning in Dynamic Scenes

Feng Gao, Jincheng Yu|arXiv (Cornell University)|Nov 18, 2020
Advanced Vision and Imaging被引用数 7
ひとこと要約

本稿では、動的シーンにおける自己教師付き単眼深度および自己運動推定のための注目メカニズムを用いた分離・集約ネットワーク(ASANet)を提案する。注目メカニズムにより静的・動的シーン特徴を分離し、静的領域には自己運動、動的物体には運動場を自動選択的に適用するメカニズムを導入することで、最小限の計算コストでKITTIベンチマークで最先端の性能を達成した。

ABSTRACT

Learning depth and ego-motion from unlabeled videos via self-supervision from epipolar projection can improve the robustness and accuracy of the 3D perception and localization of vision-based robots. However, the rigid projection computed by ego-motion cannot represent all scene points, such as points on moving objects, leading to false guidance in these regions. To address this problem, we propose an Attentional Separation-and-Aggregation Network (ASANet), which can learn to distinguish and extract the scene's static and dynamic characteristics via the attention mechanism. We further propose a novel MotionNet with an ASANet as the encoder, followed by two separate decoders, to estimate the camera's ego-motion and the scene's dynamic motion field. Then, we introduce an auto-selecting approach to detect the moving objects for dynamic-aware learning automatically. Empirical experiments demonstrate that our method can achieve the state-of-the-art performance on the KITTI benchmark.

研究の動機と目的

  • 単眼動画における動的物体の影響が自己教師付き深度および自己運動推定に与える影響を軽減すること。
  • 外部アノテーションや事前学習済みセグメンテーションモデルに依存せずに、動的認識学習を可能にすること。
  • 純粋な自己教師付き学習下で、深度、自己運動、運動場を同時に推定する軽量でエンドツーエンドのシステムを構築すること。
  • パrameter数が少なく、リアルタイム推論速度を達成する最先端の性能をKITTで実現すること。

提案手法

  • ASANetは、各層でソフト注目ベースの分解を用いて、静的および動的特徴を別々に処理する2つの共有重み特徴パスを用いる。
  • 特徴はパス間で集約され、反復的な分離・集約操作により表現を精緻化する。
  • MotionNetアーキテクチャは、ASANetをエンコーダーとして用い、自己運動と動的運動場推定のための2つのデコーダーを持つ。
  • 自動選択メカニズムにより、動的物体を動的に特定し、監視信号の構築に適切な変換(自己運動または運動場)を適用する。
  • エピポラーパターン整合性損失と幾何学的整合性正則化(L_ge)を活用し、監視信号の品質を向上させる。
  • 段階的学習スケジュールを用いて、動的認識特徴学習を段階的に精緻化する。

実験結果

リサーチクエスチョン

  • RQ1外部監視なしに、注目ベースのネットワークが単眼動画における静的・動的シーン成分を効果的に分離できるか?
  • RQ2任意の動的物体が存在する状況下で、自己教師付き深度および自己運動推定をどのように改善できるか?
  • RQ3トレーニング中に、異なるシーン領域に対して適切な変換(自己運動対運動場)を自動選択的に割り当てられるメカニズムは構築可能か?
  • RQ4提案手法は、既存手法と比較して計算コストを低減しつつ、最先端の性能を達成できるか?

主な発見

  • 提案手法はKITTIベンチマークで最先端の性能を達成し、深度推定およびビジュアルオドメトリのタスクでMonodepth2およびPackNet-SfMを上回った。
  • ResNet-18バックボーンを用いた場合、KITTIで絶対相対誤差(Abs Rel)が0.112、二乗相対誤差(Sq Rel)が0.867、δ1.25が0.882を達成し、ベースラインのMonodepth2を上回った。
  • ASANetと自動選択メカニズムの導入により、Abs Relは0.003低下し、δ1.25は0.005向上した。
  • 50 fpsのリアルタイム推論を維持しており、ORB-SLAM2に比べて顕著に高速で、他のワンステージエンドツーエンド手法と同等の性能を示した。
  • パrameter数が14.84M(ResNet-18)にとどまり、PackNet-SfM(D=4時で78.49M)の半分未満と非常に軽量であった。
  • より深いResNet-50を用いても、自動選択メカニズムは一貫して性能向上をもたらし、Abs Relを0.109から0.108に低下させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。