Skip to main content
QUICK REVIEW

[論文レビュー] LEGO: Learning Edge with Geometry all at Once by Watching Videos

Zhenheng Yang, Peng Wang|arXiv (Cornell University)|Mar 15, 2018
Advanced Vision and Imaging参考文献 52被引用数 21
ひとこと要約

LEGOは、意味的カテゴリ間の幾何的整合性を活用し、関連するクラス(例:道路、歩道)を統合した表面にまとめて、統合セグメンテーションからエッジを抽出することで、動画データから幾何的エッジアノテーションを自己教師付きで生成する手法を提案する。主な貢献は、動画を用いてエッジの教師強化学習をエンドツーエンドで行い、手動アノテーションなしで正確な幾何的エッジ検出を達成することである。

ABSTRACT

Learning to estimate 3D geometry in a single image by watching unlabeled videos via deep convolutional network is attracting significant attention. In this paper, we introduce a "3D as-smooth-as-possible (3D-ASAP)" prior inside the pipeline, which enables joint estimation of edges and 3D scene, yielding results with significant improvement in accuracy for fine detailed structures. Specifically, we define the 3D-ASAP prior by requiring that any two points recovered in 3D from an image should lie on an existing planar surface if no other cues provided. We design an unsupervised framework that Learns Edges and Geometry (depth, normal) all at Once (LEGO). The predicted edges are embedded into depth and surface normal smoothness terms, where pixels without edges in-between are constrained to satisfy the prior. In our framework, the predicted depths, normals and edges are forced to be consistent all the time. We conduct experiments on KITTI to evaluate our estimated geometry and CityScapes to perform edge evaluation. We show that in all of the tasks, i.e.depth, normal and edge, our algorithm vastly outperforms other state-of-the-art (SOTA) algorithms, demonstrating the benefits of our approach.

研究の動機と目的

  • 手動エッジアノテーションの必要性をなくし、動画データから幾何的エッジ教師強化学習を生成すること。
  • 意味的に関連するが幾何的に接続されたカテゴリ(例:道路と歩道)間で幾何的整合性を強制することで、エッジ検出の精度を向上させること。
  • 動画シーケンスから直接幾何的構造を学ぶ自己教師付きフレームワークを開発すること。
  • 意味的に異なるが幾何的に接続されたカテゴリ(例:電柱、交通標識)を単一の表面に統合し、一貫したエッジ抽出を可能とすること。
  • 幾何的制約と動画ベースの学習を組み合わせることで、エンドツーエンドのエッジ監視を可能とすること。

提案手法

  • 同じ3次元表面を共有する意味的カテゴリ(例:'道路'、'歩道'、'駐車場')を1つの統合カテゴリに統合し、幾何的連続性を保証する。
  • 統合セグメンテーション結果の境界からエッジ教師強化学習を生成し、インスタンス間エッジを保持する。
  • 幾何的制約を適用:同じ3次元表面上の点では、表面法線が一貫している必要がある(式4)。
  • 直線の一貫性を課す:3次元直線上の3点が同一直線上にある場合、隣接する点対間の勾配は等しくなければならない(式5)。
  • 平面方程式(例:a₁x + b₁y + c₁z = 1)などの代数的制約を用いて、直線および表面の一貫性を形式化する。
  • 動画データから、同じ表面または直線上の点が一貫した法線および勾配関係を維持するように、幾何的整合性を強制する。

実験結果

リサーチクエスチョン

  • RQ1手動ラベルなしに、動画から幾何的エッジアノテーションを自動的に生成できるか?
  • RQ2意味的に異なるが幾何的に接続されたカテゴリ(例:道路と歩道)をどのように統合すればエッジ検出を向上させられるか?
  • RQ3動画フレーム間でエッジ予測の一貫性を強制するために、どのような幾何的制約を用いることができるか?
  • RQ4動画からの自己教師付き学習が、人為的アノテーションデータと同等の正確なエッジ教師強化学習を達成できるか?
  • RQ5幾何的制約(法線および勾配の一貫性)は、エッジ検出性能をどのように向上させるか?

主な発見

  • 本手法は、同じ3次元表面を共有するカテゴリ(例:'地面'、'電柱'、'自転車乗り'、'壁')を統合することで、幾何的エッジ教師強化学習を効果的に生成した。
  • 幾何的に一貫したカテゴリの統合時にインスタンス境界を保持することで、エッジ検出がインスタンス境界を越えても維持された。
  • 数学的制約を用いて幾何的整合性を強制した:同じ3次元表面上の点では法線が等しくなければならない(式4)。
  • 3次元直線上の3点に対して、各点対間の勾配は同一でなければならない。これは式5で形式化された。
  • 平面方程式(例:a₁x + b₁y + c₁z = 1)の使用により、直線および表面の一貫性を代数的に検証可能となった。
  • フレームワークにより、動画からのエンドツーエンドの幾何的エッジ監視が可能になり、手動エッジアノテーションへの依存が排除された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。