Skip to main content
QUICK REVIEW

[論文レビュー] P$^{2}$Net: Patch-match and Plane-regularization for Unsupervised Indoor Depth Estimation

Zehao Yu, Lei Jin|arXiv (Cornell University)|Jul 15, 2020
Advanced Vision and Imaging参考文献 59被引用数 10
ひとこと要約

P$^{2}$Net は、高勾配キーポイントを中心にしたパッチベースの表現と、スーパーピクセルの事前知識を用いた平面一貫性の強制により、テクスチャが乏しい領域における頑健性を向上させる、画期的な教師なしインDoor深度推定手法を提案する。本手法は、パッチマッチングによる特徴の識別能の向上と幾何的正則化を実現し、NYUv2 および ScanNet で最先端の性能を達成しており、従来の教師なし手法と比べて顕著な性能向上を示している。

ABSTRACT

This paper tackles the unsupervised depth estimation task in indoor environments. The task is extremely challenging because of the vast areas of non-texture regions in these scenes. These areas could overwhelm the optimization process in the commonly used unsupervised depth estimation framework proposed for outdoor environments. However, even when those regions are masked out, the performance is still unsatisfactory. In this paper, we argue that the poor performance suffers from the non-discriminative point-based matching. To this end, we propose P$^2$Net. We first extract points with large local gradients and adopt patches centered at each point as its representation. Multiview consistency loss is then defined over patches. This operation significantly improves the robustness of the network training. Furthermore, because those textureless regions in indoor scenes (e.g., wall, floor, roof, \etc) usually correspond to planar regions, we propose to leverage superpixels as a plane prior. We enforce the predicted depth to be well fitted by a plane within each superpixel. Extensive experiments on NYUv2 and ScanNet show that our P$^2$Net outperforms existing approaches by a large margin. Code is available at \url{https://github.com/svip-lab/Indoor-SfMLearner}.

研究の動機と目的

  • テクスチャが乏しい領域が広がるインDoorシーンにおける教師なし深度推定の課題に対処すること。特に、点マッチングの曖昧さにより、光度的一致性損失が失敗する状況を想定する。
  • 点ベースの表現によるマッチングの限界を克服すること。特に、テクスチャが乏しい領域で誤った対応関係が生じる問題を解消する。
  • 特に壁や床のような均一な領域における平面構造という幾何的事前知識を組み込むことで、深度推定の頑健性を向上させること。
  • 事前マッチングやスパースな対応関係推定の必要性を排除し、直接的かつエンドツーエンドの学習パイプラインを実現すること。

提案手法

  • 本手法は、テクスチャが乏しい領域におけるマッチングの信頼性を向上させるために、局所的な勾配が大きいキーポイントを選択する。
  • 各キーポイントをその点を中心とした局所的パッチで表現することで、点ベースの表現からパッチベースの表現に置き換える。これにより、識別能が向上する。
  • パッチワープ機構を導入し、各パッチ内で深度が一様であると仮定する。これにより、複数視点における光度的一致性がパッチ単位で強制される。
  • スーパーピクセルを用いてシーン内の平面領域を特定し、各スーパーピクセル内での平面的一致性損失を適用することで、予測深度が低誤差の平面に適合することを保証する。
  • 明示的な対応関係初期化を必要とせず、パッチベースの光度的一致性損失と平面適合損失の組み合わせを用いて、エンドツーエンドでネットワークを学習する。
  • 標準的なプロトコルに従い、評価時に予測値をスケーリングすることで、単眼深度推定におけるスケールの曖昧性を回避する。

実験結果

リサーチクエスチョン

  • RQ1テクスチャが乏しいインDoorシーンにおける教師なし深度推定において、パッチベースの表現がマッチングの頑健性を向上させることができるか?
  • RQ2スーパーピクセル領域内で平面的一致性を強制することで、大規模なテクスチャが乏しい領域における深度推定の精度にどのような影響を与えるか?
  • RQ3パッチベースの光度的一致性とスーパーピクセルベースの平面正則化を組み合わせることで、点ベースの手法よりも優れた一般化性能が得られるか?
  • RQ4事前計算されたスパースな対応関係を必要としない直接的でエンドツーエンドの学習フレームワークが、教師なしインDoor深度推定において、対応関係を事前に推定する手法を上回る性能を発揮できるか?

主な発見

  • NYUv2 データセットにおいて、P$^{2}$Net はテスト誤差として 0.599 (rms)、0.159 (rel)、0.772 (δ<1.25) を達成し、ベースライン手法および従来の教師なし手法を大きく上回った。
  • アブレーションスタディの結果、パッチベースのマッチングと平面正則化を組み合わせた場合が最良の性能を示した。パッチモジュールのみを用いることで、rms は 0.786 から 0.612 に低下した。
  • ScanNet では、カメラポーズ推定誤差が 1.86° (回転) および 35.11° (並進) であり、MovingIndoor を上回り、優れた一般化性能を示した。
  • KITTI では、モノバ2 と比較して δ<1.25 で 1.5% の相対的改善を達成したが、これは移動物体を特に考慮して設計されたものではない。
  • パッチパターンサイズのアブレーションでは、N=3 が最適な性能を示した。N=4 以降の大きなパターンはノイズを導入し、性能を低下させた。
  • 可視化結果から、P$^{2}$Net が生成する表面法線および 3D ポイントクラウドは、特に壁や床領域において、MovingIndoor よりも良好に平面境界を保持していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。