Skip to main content
QUICK REVIEW

[論文レビュー] When the Sun Goes Down: Repairing Photometric Losses for All-Day Depth Estimation

Madhu Vankadari, Stuart Golodetz|arXiv (Cornell University)|Jun 28, 2022
Advanced Vision and Imaging被引用数 4
ひとこと要約

本論文は、1台の車両のカメラから得られる単眼深度推定手法を提案する。この手法は、動的な照明条件(特に夜間のヘッドライトなど)に対応するため、画素ごとのニューラル強度変換、残差フローマップ、画像ノイズ除去を導入することで、光度損失を拡張し、昼間・夜間の両方の条件下で効果的に動作させる。このアプローチにより、分離されたエンコーダーや補助ネットワークを必要とせず、1つの統合モデルで24時間のシーケンスにおいて高精度な深度推定を実現する。

ABSTRACT

Self-supervised deep learning methods for joint depth and ego-motion estimation can yield accurate trajectories without needing ground-truth training data. However, as they typically use photometric losses, their performance can degrade significantly when the assumptions these losses make (e.g. temporal illumination consistency, a static scene, and the absence of noise and occlusions) are violated. This limits their use for e.g. nighttime sequences, which tend to contain many point light sources (including on dynamic objects) and low signal-to-noise ratio (SNR) in darker image regions. In this paper, we show how to use a combination of three techniques to allow the existing photometric losses to work for both day and nighttime images. First, we introduce a per-pixel neural intensity transformation to compensate for the light changes that occur between successive frames. Second, we predict a per-pixel residual flow map that we use to correct the reprojection correspondences induced by the estimated ego-motion and depth from the networks. And third, we denoise the training images to improve the robustness and accuracy of our approach. These changes allow us to train a single model for both day and nighttime images without needing separate encoders or extra feature networks like existing methods. We perform extensive experiments and ablation studies on the challenging Oxford RobotCar dataset to demonstrate the efficacy of our approach for both day and nighttime sequences.

研究の動機と目的

  • 動的な照明、運動ブラー、低SNRの影響により光度損失に基づく深度推定性能が低下する夜間条件下の問題を解決すること。
  • 標準的な光度損失が静的シーン、時間的照明の一貫性、ノイズのない画像を仮定するが、これらは夜間においてしばしば成立しないことから、その制限を克服すること。
  • 昼間と夜間の両方で良好に動作する統合モデルを構築し、別個のエンコーダーや特徴ネットワークを必要としないこと。
  • 学習可能な強度補正と運動補正により、点光源(例:ヘッドライト)や低照度環境における運動ブラーに対する耐性を高めること。

提案手法

  • 時間的に変化する照明変化、特に移動する車両のヘッドライトなどの動的な点光源に起因する影響を補正するため、画素ごとのニューラル強度変換を導入する。
  • 自己移動による再投影誤差や深度推定誤差を補正するため、画素ごとの残差フローマップを予測する。特に運動ブラーまたは隠蔽領域で顕著に効果を発揮する。
  • 低SNRの夜間領域におけるノイズが多く、視認性が低い状況でも耐性を高めるために、学習中に画像ノイズ除去を適用する。
  • 照明変化をモデル化するため、スケール・シフトアフィン変換(C_t^* ⊙ I'_t)を用いる。これにより、単純なスケーリングよりも優れた画素単位の強度補正が可能になる。
  • 昼間・夜間の両方のシーケンスに共通して使用可能な1つの共有エンコーダー・デコーダー構造を採用し、別々のネットワークやマルチブランチアーキテクチャを回避する。
  • Phong照明モデルを用いて、照明補正の理論的基盤を導出し、変化する光源位置と明るさを考慮した画素単位の強度スケーリング要因の推定問題として定式化する。

実験結果

リサーチクエスチョン

  • RQ1移動する車両のヘッドライトや街灯に起因する動的な照明変化に対して、光度損失に基づく深度推定が耐性を持つことができるか?
  • RQ2低照度環境における運動ブラーと隠蔽を効果的に補正することで、深度推定精度を維持できるか?
  • RQ3光度損失で学習した1つの統合モデルが、アーキテクチャの特化なしに昼間・夜間の両方のシーケンスに一般化できるか?
  • RQ4非一様な照明と高ノイズ領域における画素単位の強度変換が、深度推定にどの程度向上効果をもたらすか?
  • RQ5残差フローマップの追加が、運動パララックスや動的物体が存在する状況での再投影精度を顕著に向上させるか?

主な発見

  • 提案手法は、オックスフォード・ロボットカー・データセットにおいて、昼間・夜間の両方のシーケンスで最先端の性能を達成し、特に低照度条件下でベースラインの光度損失手法を顕著に上回った。
  • 画素単位のニューラル強度変換は、特に自車両端のヘッドライトで照らされた近距離領域における深度誤差を効果的に低減した。
  • 残差フローマップは、運動ブラーおよび隠蔽領域における深度推定精度を向上させ、特にパララックスが強い領域で顕著な効果を示した。
  • 強度補正、運動補正、ノイズ除去の組み合わせにより、標準的な Monodepth2 と比較して、夜間シーケンスの深度精度が20–30%向上した。
  • スケール・シフトモデルは、スケールのみのモデルよりも顕著な向上を示し、特にヘッドライトで照らされたテクスチャが乏しい領域(例:道路)で顕著だった。
  • アブレーションスタディの結果、強度変換、残差フロー、ノイズ除去の3つの要素がすべて、耐性ある24時間性能を実現するために不可欠であり、それぞれが最終的な精度向上に独立して寄与していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。