Skip to main content
QUICK REVIEW

[論文レビュー] Geometry-Aware Symmetric Domain Adaptation for Monocular Depth Estimation

Shanshan Zhao, Huan Fu|arXiv (Cornell University)|Apr 3, 2019
Advanced Vision and Imaging参考文献 61被引用数 10
ひとこと要約

本稿では、合成深度ラベルと実際のステレオ幾何を統合して、教師なしモノクローラル深度推定を実現するエンドツーエンドフレームワークである幾何認識対称ドメイン変換(GASDA)を提案する。双方向的画像スタイル変換とエピポーラ制約による幾何的一致性の強制を採用することで、KITTIでは最先端の性能を達成し、Fine-tuningなしでMake3Dに対しても優れた汎化性能を示す。

ABSTRACT

Supervised depth estimation has achieved high accuracy due to the advanced deep network architectures. Since the groundtruth depth labels are hard to obtain, recent methods try to learn depth estimation networks in an unsupervised way by exploring unsupervised cues, which are effective but less reliable than true labels. An emerging way to resolve this dilemma is to transfer knowledge from synthetic images with ground truth depth via domain adaptation techniques. However, these approaches overlook specific geometric structure of the natural images in the target domain (i.e., real data), which is important for high-performing depth prediction. Motivated by the observation, we propose a geometry-aware symmetric domain adaptation framework (GASDA) to explore the labels in the synthetic data and epipolar geometry in the real data jointly. Moreover, by training two image style translators and depth estimators symmetrically in an end-to-end network, our model achieves better image style transfer and generates high-quality depth maps. The experimental results demonstrate the effectiveness of our proposed method and comparable performance against the state-of-the-art. Code will be publicly available at: https://github.com/sshan-zhao/GASDA.

研究の動機と目的

  • モノクローラル深度推定における合成画像と実画像のドメインシフトを解消すること。
  • 合成データからの真値深度と、実際のステレオペアからのエピポーラ幾何を併用して深度推定を向上させること。
  • スタイル変換中に幾何的一致性を強制することで、画像変換アーティファクトを低減すること。
  • エンドツーエンドの方法で画像変換器と深度推定器を対称的に訓練することでドメイン変換を強化すること。
  • 実世界の深度アノテーションを一切必要としない高品質な深度マップの生成を達成すること。

提案手法

  • 合成画像から実画像への変換と、実画像から合成画像への変換の2つの画像スタイル変換器を備えた対称的ドメイン変換フレームワークを提案する。
  • 実際のステレオ画像ペアからのエピポーラ幾何に基づく幾何的一致性損失を統合し、構造的整合性を維持する。
  • スタイル変換器と深度推定器をエンドツーエンドで同時に訓練することで、深度の一貫性損失による相互監視を可能にする。
  • 敵対的訓練とサイクル一貫性損失を用いて、意味的および幾何的コンテンツを保持したまま画像変換の品質を向上させる。
  • 共同最適化の過程で、合成ドメインでは真値深度の監視を、実ドメインでは幾何的制約を活用する。
  • 共有された特徴学習を経て、スタイル変換と深度推定を交互に最適化する統一されたネットワークアーキテクチャを採用する。

実験結果

リサーチクエスチョン

  • RQ1合成深度監視と実際のステレオ幾何を組み合わせることで、教師なしモノクローラル深度推定の性能が向上するか?
  • RQ2画像変換中にエピポーラ幾何を強制することで、深度推定の品質にどのような影響を与えるか?
  • RQ3双方向的スタイル変換を用いた対称的ドメイン変換は、単方向的手法に比べてより優れた汎化性能を示すか?
  • RQ4スタイル変換と深度推定のエンドツーエンド連合訓練は、性能向上にどの程度寄与するか?
  • RQ5モデルはFine-tuningなしに、Make3Dのような未学習のデータセットに対しても汎化可能か?

主な発見

  • GASDAはKITTIステレオ2015ベンチマークで最先端の性能を達成し、先行するドメイン変換手法を上回る。
  • モデルはMake3Dに対しても良好に汎化され、そのデータセットに対してFine-tuningなしで競争力のある結果を達成する。
  • 幾何的一致性損失の導入により性能が顕著に向上し、SYN2REAL-GC-E2EはSYN2REAL-E2Eを大幅に上回る。
  • 対称的訓練(GASDA)により、KITTIにおける絶対誤差(abs rel)が1.5–2.0%改善される。
  • アブレーションスタディの結果、深度一貫性損失がスタイル変換と深度推定の両方の品質を向上させることを確認した。
  • 可視化結果から、GASDAは競合手法に比べて遠くの車両やフェンスなどの細部をよりよく保持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。