Skip to main content
QUICK REVIEW

[論文レビュー] Feature-metric Loss for Self-supervised Learning of Depth and Egomotion

Chang Shu, Kun Yu|arXiv (Cornell University)|Jul 21, 2020
Advanced Vision and Imaging参考文献 56被引用数 16
ひとこと要約

本稿では、自己教師付き深度およびエゴモーション推定のための特徴マトリクス損失を提案する。自己符号化器ネットワークを用いて特徴表現を正則化し、1次(識別的)および2次(収束性)勾配損失により、望ましい最適化の形状を形成する。この手法により、KITTI上での深度推定性能が顕著に向上し、$δ_1$を0.885から0.925に改善し、視覚オドメトリにおいても先行手法を大きく上回る結果を得た。

ABSTRACT

Photometric loss is widely used for self-supervised depth and egomotion estimation. However, the loss landscapes induced by photometric differences are often problematic for optimization, caused by plateau landscapes for pixels in textureless regions or multiple local minima for less discriminative pixels. In this work, feature-metric loss is proposed and defined on feature representation, where the feature representation is also learned in a self-supervised manner and regularized by both first-order and second-order derivatives to constrain the loss landscapes to form proper convergence basins. Comprehensive experiments and detailed analysis via visualization demonstrate the effectiveness of the proposed feature-metric loss. In particular, our method improves state-of-the-art methods on KITTI from 0.885 to 0.925 measured by $δ_1$ for depth estimation, and significantly outperforms previous method for visual odometry.

研究の動機と目的

  • 顔料損失の限界、特に模様のない領域やコントラストが低い領域における自己教師付き深度およびエゴモーション推定の課題を解消すること。
  • 学習された特徴表現を用いて損失の形状を調整することで、最適化の安定性と収束性を向上させること。
  • 自己教師付きフレームワークを用いて、長距離の深度伝搬と境界の詳細を保持した堅牢な推定を可能にすること。
  • 教師なしの環境下で、単眼深度および視覚オドメトリベンチマークで最先端の性能を達成すること。

提案手法

  • 3ストリームネットワークを導入:DepthNetとPoseNetはクロスビュー再構成を、FeatureNetは単一ビュー再構成を担当する。
  • FeatureNetから得られる学習済み特徴表現に基づく特徴マトリクス損失を定義し、顔料損失の置き換えまたは補完として用いる。
  • 1次勾配を介してピクセル間の特徴差を促進する識別的損失を実装し、識別性を向上させる。
  • 特徴勾配の分散をペナルティ化することで、広い収束盆地を促進し、最適化の安定性を向上させる収束損失を適用する。
  • 再構成損失、識別的損失、収束損失を統合して、深度、エゴモーション、特徴表現のエンドツーエンド訓練と共同最適化を実現する。
  • 主成分分析(PCA)を用いた可視化により、学習済み特徴マップの分析と表現学習の品質の妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1自己教師付き特徴表現学習は、深度およびエゴモーション推定における最適化の安定性と収束性を向上させ得るか?
  • RQ2模様のない領域において、特徴ベースの損失形状は顔料損失および滑らかさベースの損失を上回るか?
  • RQ3正則化された特徴学習により、境界の詳細を保持しながら長距離の深度伝搬が可能になるか?
  • RQ4特徴マトリクス損失は、先行の自己教師付き手法と比較して、視覚オドメトリ性能をどの程度向上させるか?

主な発見

  • 提案された特徴マトリクス損失により、KITTI上での深度推定性能が$δ_1$ 0.885から0.925に向上し、最先端の結果を達成した。
  • 視覚オドメトリにおいて、本手法は以前の自己教師付きアプローチを著しく上回り、軌道誤差($t_{err}$)と回転誤差($r_{err}$)ともに低減した。
  • 学習済み特徴の可視化から、$π_{rec}$、$π_{dis}$、$π_{cvt}$損失の組み合わせが、勾配降下に適した滑らかで盆地状の損失形状を生成することが示された。
  • 3つの損失すべて($π_{rec} + π_{dis} + π_{cvt}$)を備えたモデルが最良の性能を示したが、$π_{cvt}$を省略すると、不安定でジグザグ状の特徴マップが生じた。
  • オンラインリファインメントでは、誤差補正における強力でより識別的な監視のおかげで、特徴マトリクス損失がより顕著な恩恵をもたらした。
  • 自己符号化器パスを介して学習された特徴表現は、顔料損失単体よりも模様のない領域でより頑健であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。