Skip to main content
QUICK REVIEW

[論文レビュー] Web Stereo Video Supervision for Depth Prediction from Dynamic Scenes

Chaoyang Wang, Simon Lucey|arXiv (Cornell University)|Apr 25, 2019
Advanced Vision and Imaging参考文献 39被引用数 6
ひとこと要約

本論文は、ウェブスクレイピングされたステレオ動画を弱い教師信号として用い、剛体でない動的シーンにおける単眼深度推定のデータ駆動型手法を提案する。カメラ内部パrameter や基線が既知でない状況を回避するための新しい正規化マルチスケール勾配損失を導入することで、順次フレームからの正確な深度を予測するモデルを学習する。本手法は、剛体でないシーン(例:動く人物を含む)において、単一画像手法や既存のマルチビュー手法を上回る性能を発揮する。

ABSTRACT

We present a fully data-driven method to compute depth from diverse monocular video sequences that contain large amounts of non-rigid objects, e.g., people. In order to learn reconstruction cues for non-rigid scenes, we introduce a new dataset consisting of stereo videos scraped in-the-wild. This dataset has a wide variety of scene types, and features large amounts of nonrigid objects, especially people. From this, we compute disparity maps to be used as supervision to train our approach. We propose a loss function that allows us to generate a depth prediction even with unknown camera intrinsics and stereo baselines in the dataset. We validate the use of large amounts of Internet video by evaluating our method on existing video datasets with depth supervision, including SINTEL, and KITTI, and show that our approach generalizes better to natural scenes.

研究の動機と目的

  • 剛体でない動的シーンにおける深度推定の課題に取り組む。従来の幾何的手法は剛体性の欠如により機能しないため。
  • 剛体シーンや単一画像に依存する既存のデータ駆動型手法の限界を克服する。動画からの時間的および幾何的ヒントを活用することで。
  • 未知のカメラ内部パrameter や基線を伴う未キャリブレーションのインターネット由来ステレオ動画を教師信号として使用する学習フレームワークを開発する。
  • 現実的で非剛体なシーンを対象とした大規模かつ多様な、屋外環境のステレオ動画データセットを構築する。

提案手法

  • 屋外で収集された多様なシーンと豊富な非剛体オブジェクト(例:人物)を含む、大規模(150万フレーム)なウェブスクレイピングステレオ動画データセットを用いる。
  • ステレオ動画から視差マップを計算し、深度予測ネットワークの弱い教師信号として使用する。
  • 視差差と逆深度差の幾何的関係を活用することで、未知のカメラ内部パrameter や基線を前提としない、新しい正規化マルチスケール勾配損失を提案する。
  • ネットワークは2つの連続する単眼フレームとオプティカルフローを入力とし、単一画像からのセマンティックヒントと動きからの幾何的ヒントを統合する。
  • 損失関数は相対的深度距離の保持を目的とし、順序付き損失よりも滑らかで正確な深度マップを生成する。
  • 本手法はエンドツーエンドで学習され、KITTやSintelといった実世界データセットに対しても、明示的なカメラキャリブレーションがなくても良好な一般化性能を示す。

実験結果

リサーチクエスチョン

  • RQ1未キャリブレーションでインターネット由来のステレオ動画で学習したデータ駆動型モデルは、実世界の非剛体シーンにおける深度推定に一般化可能か?
  • RQ2カメラ内部パrameter や基線が動画シーケンス全体で不明または変動する状況において、深度推定をどのように教師することができるか?
  • RQ3オプティカルフローと連続フレームからの時間的情報を統合することで、単一画像ベースラインに比べ、非剛体シーンにおける深度推定性能が向上するか?
  • RQ4相対的深度差を保持する損失関数は、順序付き損失やスケール不変損失に比べ、未キャリブレーション環境下で優れた性能を発揮するか?
  • RQ5複雑な人体運動が存在する状況において、本手法の性能は剛体・非剛体シーンの両方で最先端手法を上回るか?

主な発見

  • 提案手法は、KITTIの歩行者サブセットにおいてMegaDepth やRedWebといった単一画像深度推定モデルを上回り、非剛体シーンへの一般化性能が優れていることを示している。
  • Sintelデータセットでは、NMG 0.890、MRE 0.311、SILog 0.172を達成し、DEMON手法を上回り、複数のデータセットにわたる強力な一般化性能を示している。
  • 本研究で提案するWSVDデータセットで学習させることで、Sintelでは誤差が低減し、KITTIでもKITTIや他の剛体シーンデータセットで学習したモデルに比べて性能が向上した。
  • オプティカルフローと2番目のフレームを入力に追加することで、SintelにおけるNMGは0.993から0.890に低下し、時間的情報が深度推定に顕著に寄与することが確認された。
  • KITTIで学習したモデルに比べ、他のデータセットでも本モデルの一般化性能が優れており、WSVDデータセットの多様性がドメインシフトに対する耐性を高めていることが示唆された。
  • 限界として、テクスチャが乏しい領域や遠距離シーンではステレオ対応が失敗し、不正確な深度予測が生じる場合がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。