Skip to main content
QUICK REVIEW

[論文レビュー] Exploiting temporal consistency for real-time video depth estimation

Haokui Zhang, Chunhua Shen|arXiv (Cornell University)|Aug 10, 2019
Advanced Vision and Imaging参考文献 45被引用数 13
ひとこと要約

本論文は、2次元畳み込みニューラルネットワーク(2D CNN)と畳み込みLSTMを組み合わせて空間的特徴とフレーム間の時間的相関を捉える、空間的・時間的LSTM(ST-CLSTM)アーキテクチャを用いたリアルタイム動画深度推定フレームワークを提案する。時間的整合性を向上させるために生成的敵対的学習に基づく時間的整合性損失を導入し、計算コストを最小限に抑えながら、並列データローディングを用いて174.83 fpsのリアルタイム推論を実現し、最先端の性能を達成した。

ABSTRACT

Accuracy of depth estimation from static images has been significantly improved recently, by exploiting hierarchical features from deep convolutional neural networks (CNNs). Compared with static images, vast information exists among video frames and can be exploited to improve the depth estimation performance. In this work, we focus on exploring temporal information from monocular videos for depth estimation. Specifically, we take the advantage of convolutional long short-term memory (CLSTM) and propose a novel spatial-temporal CSLTM (ST-CLSTM) structure. Our ST-CLSTM structure can capture not only the spatial features but also the temporal correlations/consistency among consecutive video frames with negligible increase in computational cost. Additionally, in order to maintain the temporal consistency among the estimated depth frames, we apply the generative adversarial learning scheme and design a temporal consistency loss. The temporal consistency loss is combined with the spatial loss to update the model in an end-to-end fashion. By taking advantage of the temporal information, we build a video depth estimation framework that runs in real-time and generates visually pleasant results. Moreover, our approach is flexible and can be generalized to most existing depth estimation frameworks. Code is available at: https://tinyurl.com/STCLSTM

研究の動機と目的

  • 自律走行やロボット工学などの応用を想定し、動画シーケンスにおけるリアルタイム深度推定の課題に取り組む。
  • 静的画像手法を上回る精度を実現するため、連続する動画フレーム間の時間的情報を活用する。
  • 計算コストを著しく増加させることなく、高い性能を維持する軽量で効率的なフレームワークを開発する。
  • 動画フレーム間で予測された深度マップの時間的整合性を確保し、視覚的に一貫性のある結果を生成する。
  • 既存の多数の深度推定アーキテクチャと互換性がある汎用的なフレームワークを設計する。

提案手法

  • 2次元畳み込みニューラルネットワーク(2D CNN)を用いて空間的特徴を抽出し、時間的依存性をモデル化するためのCLSTMを統合した、新規のST-CLSTM構造を提案する。
  • 時間的整合性損失を学習するために、GANフレームワークにおける識別器として3次元畳み込みニューラルネットワーク(3D CNN)を用いる。
  • 予測深度と真値深度の間の空間的損失(L1またはL2)と、敵対的時間的損失を組み合わせ、エンドツーエンドの学習を実現する。
  • 並列データローディング(PSモード)を適用し、標準的なハードウェア上でもリアルタイム性能を達成する。
  • 空間的損失と時間的損失の両方を用いてエンドツーエンドで学習させ、深度精度と時間的滑らかさを同時に最適化する。
  • 推論コストを抑えるために、浅いResNet-18バックボーンを採用し、競争力のある性能を実現する。

実験結果

リサーチクエスチョン

  • RQ1単眼動画シーケンスにおける時間的相関は、静的画像手法を上回る深度推定性能を実現するために効果的に活用可能か?
  • RQ2深層学習モデルは、連続する動画フレーム間で予測された深度マップの時間的整合性をどのように維持できるか?
  • RQ3GANベースの敵対的損失を用いることで、時間的整合性と深度推定の視覚的品質にどのような影響を与えるか?
  • RQ4軽量なST-CLSTMアーキテクチャは、性能を犠牲にすることなくリアルタイム推論を達成可能か?
  • RQ5このフレームワークは、最小限のアーキテクチャ的変更で、既存の深度推定モデルにどの程度一般化可能か?

主な発見

  • 提案されたST-CLSTMフレームワークは、NYU Depth V2およびKITTIデータセットの両方で最先端の性能を達成し、多くのより深いモデルを上回った。
  • NYU Depth V2データセットでは、ResNet-18を用いて相対誤差(Rel)が0.131、RMSが0.571、δ1が0.833を達成し、より深いバックボーンを用いた手法を上回った。
  • KITTIデータセットでは、Relが0.101、RMSが4.137、δ1が0.890を達成し、多数の先行研究(動画および静的画像手法を含む)を上回った。
  • 並列+シリアルローディングモードで174.83 fpsで実行され、リアルタイム要件(30 fps)を大きく上回り、実用的妥当性が明確に示された。
  • アブレーションスタディの結果、ST-CLSTMとGANベースの時間的損失の両方が時間的整合性と全体的な性能を顕著に向上させた。
  • このフレームワークは非常に汎用的であり、既存の多数の深度推定アーキテクチャに最小限の変更で統合可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。