Skip to main content
QUICK REVIEW

[論文レビュー] Geometry meets semantics for semi-supervised monocular depth estimation

Pierluigi Zama Ramirez, Matteo Poggi|arXiv (Cornell University)|Oct 9, 2018
Advanced Vision and Imaging参考文献 38被引用数 12
ひとこと要約

本論文は、画像のワープから得られる幾何学的特徴とピクセルレベルのアノテーションから得られる意味的特徴を活用することで、単眼深度推定とセマンティックセグメンテーションを同時に予測する半教師ありディープラーニングフレームワークを提案する。共有エンコーダと二重デコーダを用いた特徴の共有により、KITTI上で最先端の非教師あり手法を上回る深度推定の精度を達成し、学習時にセマンティックラベルのみを用いる。

ABSTRACT

Depth estimation from a single image represents a very exciting challenge in computer vision. While other image-based depth sensing techniques leverage on the geometry between different viewpoints (e.g., stereo or structure from motion), the lack of these cues within a single image renders ill-posed the monocular depth estimation task. For inference, state-of-the-art encoder-decoder architectures for monocular depth estimation rely on effective feature representations learned at training time. For unsupervised training of these models, geometry has been effectively exploited by suitable images warping losses computed from views acquired by a stereo rig or a moving camera. In this paper, we make a further step forward showing that learning semantic information from images enables to improve effectively monocular depth estimation as well. In particular, by leveraging on semantically labeled images together with unsupervised signals gained by geometry through an image warping loss, we propose a deep learning approach aimed at joint semantic segmentation and depth estimation. Our overall learning framework is semi-supervised, as we deploy groundtruth data only in the semantic domain. At training time, our network learns a common feature representation for both tasks and a novel cross-task loss function is proposed. The experimental findings show how, jointly tackling depth prediction and semantic segmentation, allows to improve depth estimation accuracy. In particular, on the KITTI dataset our network outperforms state-of-the-art methods for monocular depth estimation.

研究の動機と目的

  • 非教師あり学習フレームワークに意味理解を統合することで、単眼深度推定の精度を向上させること。
  • 学習時に高価な深度アノテーションに依存するのを減らすために、セマンティックセグメンテーションラベルのみを用いること。
  • 深度推定とセマンティックセグメンテーションの同時学習による相乗効果を調査すること。
  • 深度は画像ワープによる自己教師あり学習、意味は真値ラベルによる教師あり学習である、半教師あり学習の枠組みを構築すること。
  • マルチタスク学習によるより豊かな特徴表現が、深度推定性能の向上に寄与することを示すこと。

提案手法

  • 単一エンコーダ/二重デコーダアーキテクチャにより、深度推定ヘッドとセマンティックセグメンテーションヘッド間で特徴を共有する。
  • 深度ヘッドは、ステレオまたは移動カメラの幾何学に基づく非教師あり画像ワープ損失を用いて学習される。
  • セマンティックセグメンテーションヘッドはピクセルレベルの真値アノテーションを用いて学習される。
  • 深度とセマンティック境界を一致させるために、新規のクロスドメイン不連続性損失が導入される。これによりエッジの一貫性が向上する。
  • 深度とセマンティックの監視をバランスさせる統合損失関数を用いて、ネットワークを同時に最適化する。
  • タスク間で特徴表現を共有することで、意味的特徴から深度推定への知識移行が可能になる。

実験結果

リサーチクエスチョン

  • RQ1セマンティックセグメンテーションと単眼深度推定を同時に学習することで、深度推定の精度が向上するか?
  • RQ2半教師あり設定において意味的監視を組み込むことで、純粋な幾何的自己教師あり学習を上回る深度予測が達成できるか?
  • RQ3セマンティック境界の統合が、特に物体エッジ付近で深度マップの品質をどのように向上させるか?
  • RQ4提案手法は、最先端の非教師あり単眼深度推定モデルをどの程度上回るか?
  • RQ5一つのモデルが、どちらのタスクの性能をも損なわず、競争力のある性能を両方で達成できるか?

主な発見

  • 提案手法は、KITTIデータセット上で最先端の非教師あり単眼深度推定モデル [1] を上回る。
  • 定性的な結果から、車両やポールのような細い構造物のような困難なオブジェクトの深度推定が改善されていることが示された。
  • セマンティックガイダンスのおかげで、車の窓のような反射的・透明な表面付近でも、より正確な深度マップが得られている。
  • VGGおよびResNet50エンコーダを用いた場合、セマンティックセグメンテーションのピクセル単位の正答率はそれぞれ88.51%および88.19%を達成した。
  • 深度推定の向上は見られたが、セマンティックセグメンテーションの正答率はまだ最先端水準に達していないため、アーキテクチャの最適化の余地があることが示唆された。
  • クロスドメイン不連続性損失は、深度とセマンティック境界の一致を効果的に実現し、予測のエッジ一貫性を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。