Skip to main content
QUICK REVIEW

[논문 리뷰] LEGO: Learning Edge with Geometry all at Once by Watching Videos

Zhenheng Yang, Peng Wang|arXiv (Cornell University)|2018. 03. 15.
Advanced Vision and Imaging참고 문헌 52인용 수 21
한 줄 요약

LEGO는 비디오 데이터에서 기하 일관성을 활용하여 다양한 의미적 카테고리 간의 기하 모양을 통합하고, 관련된 클래스(예: 도로, 보도)를 통합된 표면으로 묶어 세그멘테이션 결과에서 에지 추출을 통해 기하학적 에지 애너테이션을 자율적으로 생성하는 자기지도 학습 방법을 제안한다. 주요 기여는 비디오를 이용한 엔드 투 엔드 에지 지도 데이터 생성으로, 수동 애너테이션 없이 정밀한 기하학적 에지 검출을 달성하는 데 있다.

ABSTRACT

Learning to estimate 3D geometry in a single image by watching unlabeled videos via deep convolutional network is attracting significant attention. In this paper, we introduce a "3D as-smooth-as-possible (3D-ASAP)" prior inside the pipeline, which enables joint estimation of edges and 3D scene, yielding results with significant improvement in accuracy for fine detailed structures. Specifically, we define the 3D-ASAP prior by requiring that any two points recovered in 3D from an image should lie on an existing planar surface if no other cues provided. We design an unsupervised framework that Learns Edges and Geometry (depth, normal) all at Once (LEGO). The predicted edges are embedded into depth and surface normal smoothness terms, where pixels without edges in-between are constrained to satisfy the prior. In our framework, the predicted depths, normals and edges are forced to be consistent all the time. We conduct experiments on KITTI to evaluate our estimated geometry and CityScapes to perform edge evaluation. We show that in all of the tasks, i.e.depth, normal and edge, our algorithm vastly outperforms other state-of-the-art (SOTA) algorithms, demonstrating the benefits of our approach.

연구 동기 및 목표

  • 수동 에지 애너테이션의 필요성을 제거하기 위해 비디오 데이터에서 기하학적 에지 지도 데이터를 생성하는 것.
  • 의미적으로 관련이 있지만 기하학적으로 연결된 카테고리(예: 도로와 보도) 간의 기하 일관성을 강제하여 에지 검출 정확도를 향상시키는 것.
  • 비디오 시퀀스에서 직접 기하학적 구조를 학습하는 자기지도 학습 프레임워크를 개발하는 것.
  • 의미적으로 구분되지만 기하학적으로 연결된 카테고리(예: 기둥, 교통 표지판)를 단일 표면으로 통합하여 일관된 에지 추출을 가능하게 하는 것.
  • 기하 제약 조건과 비디오 기반 학습을 조합하여 엔드 투 엔드 에지 감독을 가능하게 하는 것.

제안 방법

  • 동일한 3D 표면을 공유하는 의미적 카테고리(예: '도로', '보도', '주차장')를 하나의 통합된 카테고리로 통합하여 기하학적 연속성을 보장한다.
  • 통합된 세그멘테이션 결과의 경계에서 에지 지도 데이터를 생성하여 인스턴스 간 경계를 유지한다.
  • 기하 제약 조건 적용: 동일한 3D 표면 상의 점들에 대해 표면 법선 벡터가 일관성이 있어야 한다(식 4).
  • 선 일관성 강제: 3개의 공선점이 동일한 3D 선상에 있을 경우, 연속된 점 쌍 간의 기울기가 동일해야 한다(식 5).
  • 평면 방정식(a₁x + b₁y + c₁z = 1)과 같은 대수적 제약 조건을 사용하여 선 및 표면 일관성을 수식화한다.
  • 비디오 데이터에서 동일한 표면 또는 선상에 있는 점들이 일관된 법선 및 기울기 관계를 유지하도록 함으로써 기하 일관성을 도출한다.

실험 결과

연구 질문

  • RQ1수동 레이블링 없이 비디오에서 기하학적 에지 애너테이션을 자동으로 생성할 수 있는가?
  • RQ2의미적으로 구분되지만 기하학적으로 연결된 카테고리(예: 도로와 보도)는 어떻게 통합하여 에지 검출을 향상시킬 수 있는가?
  • RQ3비디오 프레임 간의 에지 예측 일관성을 강제하기 위해 어떤 기하 제약 조건을 사용할 수 있는가?
  • RQ4비디오에서의 자기지도 학습이 수동 애너테이션 데이터 수준의 정확도를 갖는 에지 지도 데이터를 생성할 수 있는가?
  • RQ5기하 제약 조건(법선 및 기울기 일관성)이 에지 검출 성능을 어떻게 향상시키는가?

주요 결과

  • 이 방법은 '지면', '기둥', '자전거 탑승자', '벽'과 같이 동일한 3D 표면을 공유하는 의미적 카테고리를 통합함으로써 기하학적 에지 지도 데이터를 성공적으로 생성한다.
  • 기하학적으로 일관된 카테고리를 통합하는 과정에서 인스턴스 간 경계를 유지함으로써 인스턴스 경계를 넘어선 에지 검출이 유지된다.
  • 기하 일관성은 수학적 제약 조건을 통해 강제된다: 동일한 3D 표면 상의 점들에 대해 법선 벡터가 동일해야 한다(식 4).
  • 3개의 공선점이 동일한 3D 선상에 있을 경우, 각 점 쌍 간의 기울기가 동일해야 하며, 이는 식 5에 의해 수식화된다.
  • 평면 방정식(예: a₁x + b₁y + c₁z = 1)의 사용을 통해 선 및 표면 일관성의 대수적 검증이 가능해진다.
  • 이 프레임워크는 비디오에서 엔드 투 엔드 기하학적 에지 감독을 가능하게 하여 수동 에지 애너테이션에 대한 의존도를 제거한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.