Skip to main content
QUICK REVIEW

[論文レビュー] Regularizing Nighttime Weirdness: Efficient Self-supervised Monocular Depth Estimation in the Dark

Kun Wang, Zhenyu Zhang|arXiv (Cornell University)|Aug 9, 2021
Advanced Vision and Imaging参考文献 54被引用数 5
ひとこと要約

本論文は、夜間の状況に特化した自己教師付き単眼深度推定フレームワークを提案し、非ペアな深度分布を用いた正則化による訓練の安定化、輝度の一貫性を損なわずに視認性を向上させるマッピング一貫性のある画像強調、およびテクスチャレスな領域を動的に処理する統計ベースのマスクを導入している。本手法は2つの夜間ベンチマークで最先端の性能を達成し、穴や滑らかでない領域といった深度マップのアーチファクトを顕著に低減した。

ABSTRACT

Monocular depth estimation aims at predicting depth from a single image or video. Recently, self-supervised methods draw much attention since they are free of depth annotations and achieve impressive performance on several daytime benchmarks. However, they produce weird outputs in more challenging nighttime scenarios because of low visibility and varying illuminations, which bring weak textures and break brightness-consistency assumption, respectively. To address these problems, in this paper we propose a novel framework with several improvements: (1) we introduce Priors-Based Regularization to learn distribution knowledge from unpaired depth maps and prevent model from being incorrectly trained; (2) we leverage Mapping-Consistent Image Enhancement module to enhance image visibility and contrast while maintaining brightness consistency; and (3) we present Statistics-Based Mask strategy to tune the number of removed pixels within textureless regions, using dynamic statistics. Experimental results demonstrate the effectiveness of each component. Meanwhile, our framework achieves remarkable improvements and state-of-the-art results on two nighttime datasets.

研究の動機と目的

  • 低視認性と変動する照明による既存の自己教師付き深度モデルの夜間における失敗を解消すること。
  • 自己教師付き学習における光度的一致性仮定を破るテクスチャレスな領域や輝度の一貫性の欠如を克服すること。
  • アノテーション済み深度データに依存せずに、暗く視認性の低い環境でも深度推定のロバスト性を向上させること。
  • 画像品質の向上を図りながらも幾何学的一致性を維持するフレームワークを構築すること。

提案手法

  • 敵対的学習を用いて非ペアな参照から深度分布を学習する事前知識ベース正則化(PBR)を導入し、2次元座標を入力として用いて空間的に意識的な正則化をガイドする。
  • 動画フレーム間の輝度の一貫性を保ちながら、低照度フレームのコントラストと視認性を向上させるマッピング一貫性のある画像強調(MCIE)を提案する。
  • リアルタイムでの統計を用いてテクスチャレスな領域におけるマスクピクセル数を動的に調整する統計ベースのマスク(SBM)を設計し、固定しきい値による手法よりもロバスト性を向上させる。
  • PBR、MCIE、SBMを統合したエンドツーエンドの自己教師付きフレームワークを構築し、教師なし深度監督のもとで動画の幾何学的構造を活用して深度推定を実現する。
  • PBRにおける座標画像 $I_p$ を用いることで、空間的事前知識をモデル化し、局所化精度を向上させるとともに、訓練の不安定性を低減する。
  • MCIEが入力フレームを強調し、SBMがテクスチャレス領域をマスクし、PBRが学習済み事前知識を用いて深度予測を正則化するマルチステージ訓練パイプラインを採用する。

実験結果

リサーチクエスチョン

  • RQ1どのようにして、夜間のシーンにおける低視認性やテクスチャレスな領域に対して自己教師付き深度推定をロバストにできるか?
  • RQ2非ペアな参照から得られる事前深度分布は、訓練の安定性と深度品質の向上にどの程度寄与するか?
  • RQ3動画フレーム間で一貫性のある画像強調が可能か、自己教師付き深度学習における光度的一致性を保てるか?
  • RQ4テクスチャレス領域におけるマスクピクセル数をどのようにして適応的に制御し、深度の曖昧さを低減できるか?
  • RQ5正則化、強調、動的マスクを統合することで、夜間深度推定ベンチマークで最先端の性能が達成できるか?

主な発見

  • 完全な手法は、RobotCar-Nightで相対的絶対誤差(Abs Rel)0.121を達成し、MonoDepth2の0.400と比較して70%の低減を示し、顕著な改善を確認した。
  • nuScenes-Nightでは、Abs RelをMonoDepth2の1.185から0.315に低減(73.4%の改善)、ベースラインと比較してSq Relは91.2%低減した。
  • Priors-Based Regularization(PBR)単体でも、RobotCar-NightでSq Relを92.8%、nuScenes-Nightで90.2%低減し、訓練の安定性への強力な寄与を裏付けた。
  • PBRに座標画像 $I_p$ を組み込むことで、RobotCar-NightでSq Relが11.6%、nuScenes-Nightで15.1%改善され、空間的事前知識の重要性が裏付けられた。
  • アブレーションスタディにより、PBR、MCIE、SBMの各要素が独立してかつ累積的に寄与しており、完全モデルが各変種を上回ることを確認した。
  • 定性的な結果では、特に暗く点滅する光の環境においても、穴が少なく滑らかで正確な深度マップが得られていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。