Skip to main content
QUICK REVIEW

[논문 리뷰] Semantic Photometric Bundle Adjustment on Natural Sequences

Rui Zhu, Chaoyang Wang|arXiv (Cornell University)|2017. 11. 30.
Robotics and Sensor-Based Localization참고 문헌 22인용 수 3
한 줄 요약

이 논문은 자연 이미지 시퀀스에서 밀도 높고 정확한 3D 재구성을 가능하게 하기 위해 딥 러닝 기반의 3D 형상 사전을 광학적 최적화 프레임워크에 통합한 의미론적 광학적 밸런싱 조정(PBA)을 제안한다. 의미론적 사전을 활용함으로써, 낮은 질감 조건이나 제한된 시점 커버리지 조건에서도 상태의 최신 성능을 달성하며, PBA 수준의 광학 일관성과 함께 SLAM 유사한 카메라 자세 추정을 유지한다.

ABSTRACT

The problem of obtaining dense reconstruction of an object in a natural sequence of images has been long studied in computer vision. Classically this problem has been solved through the application of bundle adjustment (BA). More recently, excellent results have been attained through the application of photometric bundle adjustment (PBA) methods -- which directly minimize the photometric error across frames. A fundamental drawback to BA & PBA, however, is: (i) their reliance on having to view all points on the object, and (ii) for the object surface to be well textured. To circumvent these limitations we propose semantic PBA which incorporates a 3D object prior, obtained through deep learning, within the photometric bundle adjustment problem. We demonstrate state of the art performance in comparison to leading methods for object reconstruction across numerous natural sequences.

연구 동기 및 목표

  • 객체가 질감이 낮거나 부분적으로만 관측될 경우, 기존의 PBA 및 광학적 밸런싱 조정(PBA)이 자연 시퀀스에서 밀도 있는 3D 형상을 재구성하는 데에 한계를 보이는 문제를 해결하기 위해.
  • 딥 러닝에서 학습된 3D 형상 사전을 PBA 최적화 파이프라인에 통합하여 재구성 밀도와 강건성을 향상시키기 위해.
  • 광범위한 시점 커버리지나 높은 질감이 필요하지 않은 자연 시퀀스에서 정확하고 글로벌하게 일관된 6DoF 카메라 자세 추정과 밀도 높은 깊이 맵 복원을 가능하게 하기 위해.
  • 시험 시점에 광학 일관성을 강제함으로써 딥 러닝 기반 3D 재구성과 기하 최적화 간 격차를 메우기 위해.

제안 방법

  • 이 방법은 카메라 자세와 깊이 맵을 동시에 최적화하면서 딥 네URAL 네트워크에서 유도된 3D 형상 사전을 통합한 의미론적 PBA 목적함수를 수립한다.
  • 예를 들어 ShapeNet에서 유래한 학습된 형상 사전을 기하학적 사전으로 사용하여 최적화를 정규화함으로써, 점들이 자가 음영에 빠지거나 질감이 낮은 경우에도 재구성을 가능하게 한다.
  • 최적화는 카메라 자세 추정을 사용해 추정된 3D 형상을 이미지 평면으로 재투영함으로써 프레임 간 광학 오차를 최소화한다.
  • 강력한 베이스라인으로 고전적 PBA(예: Ham 등 [11])의 결과를 초기화 값으로 사용하여 수렴성과 정확도를 향상시킨다.
  • 최적화 중에 실루엣 및 깊이 제약 조건을 강제하여 해를 추가로 정규화한다.
  • 평가를 위해 렌더링된 시퀀스와 자연 시퀀스를 모두 포함하는 새로운 데이터셋을 수집하였으며, 이는 기준 카메라 자세, 깊이 맵, CAD에 맞춰진 형상 정보를 포함한다.

실험 결과

연구 질문

  • RQ1기존의 PBA가 낮은 질감이나 제한된 가시성으로 실패하는 자연 이미지 시퀀스에서, 학습된 3D 형상 사전이 재구성의 밀도와 정확도를 크게 향상시킬 수 있는가?
  • RQ2PBA 최적화 파이프라인에 의미론적 사전을 통합할 경우, 카메라 자세의 초기화 오차가 클 때 수렴 강건성에 어떤 영향을 미치는가?
  • RQ3실제 자연 시퀀스에서 의미론적 PBA가 고전적 PBA 및 딥 러닝 기반 방법보다 깊이 정확도와 재구성 밀도 측면에서 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ4시험 시점에 광학 일관성을 강제하고 형상 사전을 활용할 경우, 엔드 투 엔드 학습 방법보다 더 신뢰성 있고 기하학적으로 일관된 3D 재구성을 얻을 수 있는가?

주요 결과

  • 렌더링된 시퀀스에서 제안된 방법은 깊이 오차 0.0627과 밀도 0.9342를 달성하였으며, Ham 등(0.0682 깊이 오차, 0.4732 밀도)과 openMVS(0.0731 깊이 오차, 0.5862 밀도)를 모두 능가한다.
  • 자연 시퀀스에서 방법은 깊이 오차 0.0756과 밀도 0.9076을 기록하였으며, openMVS(0.0798 깊이 오차, 0.6987 밀도)와 Ham 등(0.0804 깊이 오차, 0.6558 밀도)을 크게 앞서 간다.
  • 초기화 오차에 대한 강건성이 뛰어나, 그림 8에서 볼 수 있듯이 큰 초기 자세 오차가 있을 경우에도 안정적으로 수렴함을 입증하였다. 이는 Zhu 등 [26]보다도 수렴 안정성에서 뛰어나다.
  • 의미론적 형상 사전 덕분에 PBA 수준의 정확도를 유지하면서도 openMVS 및 Ham 등보다 더 밀도 높은 깊이 맵을 생성함으로써 SLAM 유사한 카메라 자세 추정을 달성하였다.
  • 정성적 결과에서는, 고전적 PBA 방법이 그러한 저관측 조건에서 실패하는 반면, 제안된 방법은 두 프레임만으로도 전체 3D 형상을 생성하고 글로벌하게 일관된 카메라 궤적을 생성함을 보였다.
  • 합성 데이터로 학습된 기계 학습 기반 방법(예: [3, 6])은 자연 시퀀스에서 도메인 갭 문제로 어려움을 겪는 반면, 제안된 방법은 시험 시점에 기하학적 일관성 강제 조건을 적용함으로써 강력한 성능 유지를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.