Skip to main content
QUICK REVIEW

[논문 리뷰] RelPose: Predicting Probabilistic Relative Rotation for Single Objects in the Wild

Jason Zhang, Deva Ramanan|arXiv (Cornell University)|2022. 08. 11.
Advanced Vision and Imaging인용 수 8
한 줄 요약

이 논문은 실외의 단일 물체 이미지 간 상대 회전의 확률적 예측을 위한 상향식 에너지 기반 방법인 RelPose를 제안한다. 이는 희박한 시야에서 강력한 카메라 자세 추정을 가능하게 하며, 다중 모드 분포를 에너지 기반 네트워크로 모델링하고 연관 가능성도 최적화함으로써 희박한 데이터에서 SfM 및 SLAM 기준선을 능가한다. 또한 훈련 중에 볼 수 없었던 카테고리로 일반화되어 최소한의 입력으로도 일관된 다중 시점 재구성 가능하다.

ABSTRACT

We describe a data-driven method for inferring the camera viewpoints given multiple images of an arbitrary object. This task is a core component of classic geometric pipelines such as SfM and SLAM, and also serves as a vital pre-processing requirement for contemporary neural approaches (e.g. NeRF) to object reconstruction and view synthesis. In contrast to existing correspondence-driven methods that do not perform well given sparse views, we propose a top-down prediction based approach for estimating camera viewpoints. Our key technical insight is the use of an energy-based formulation for representing distributions over relative camera rotations, thus allowing us to explicitly represent multiple camera modes arising from object symmetries or views. Leveraging these relative predictions, we jointly estimate a consistent set of camera rotations from multiple images. We show that our approach outperforms state-of-the-art SfM and SLAM methods given sparse images on both seen and unseen categories. Further, our probabilistic approach significantly outperforms directly regressing relative poses, suggesting that modeling multimodality is important for coherent joint reconstruction. We demonstrate that our system can be a stepping stone toward in-the-wild reconstruction from multi-view datasets. The project page with code and videos can be found at https://jasonyzhang.com/relpose.

연구 동기 및 목표

  • 일반적인 물체의 희박하고 자세가 없는 이미지에서 실세계 환경에서 정확한 카메라 시점 추정 문제를 해결하기 위해.
  • 희박하고 겹침이 적은 이미지 조건에서 실패하는 대응 기반 SfM 및 SLAM 방법의 한계를 극복하기 위해.
  • 기본 물체 자세가 필요 없이 상대 카메라 자세를 학습함으로써 소수의 이미지에서 강력한 다중 시점 3D 재구성 가능하게 하기 위해.
  • 물체의 대칭성이나 모호한 시야로 인한 상대 회전의 불확실성과 다중 모드를 확률적 공식을 통해 모델링하기 위해.
  • 신경 기반 3D 재구성 방법이 카메라 자세가 필요할 때 확장 가능하고 일반화 가능한 초기화를 제공하기 위해.

제안 방법

  • 이 방법은 후보 상대 자세에 대한 비정규화된 로그확률(에너지)을 예측하기 위해 에너지 기반 신경망을 사용하여 자세의 다중성에 대한 확률적 모델링이 가능하다.
  • 상대 자세는 물체 중심 기준 캐논리컬 자세에 의존하지 않도록 시점에 맞춘 좌표계에서 계산되어 일반화 성능 향상에 기여한다.
  • 이중 에너지 예측에서 유도된 연관 가능성의 최대화를 통해 다중 이미지 간 카메라 자세를 동시에 최적화한다.
  • 이미지 및 자세 특징을 추출하기 위해 리샘플링이 포함된 ResNet-50과 자세 행렬의 위치 인코딩을 사용하며, 이를 MLP를 통해 융합하여 에너지 점수를 예측한다.
  • 직접 회귀와 달리 다중 모드(예: 90도 대칭 물체의 경우 4개 모드)를 학습한 다중 모드 분포를 명시적으로 모델링함으로써 상대 자세의 다중성을 처리한다.
  • 물체가 향하는 시점이라는 가정을 바탕으로 영상의 초기화를 수행하고, 자세 일관성을 활용하여 희박한 시점 재구성의 부트스트랩을 수행한다.

실험 결과

연구 질문

  • RQ1희박하고 겹침이 적은 이미지에서 카메라 자세를 추정할 때, 데이터 기반 상향식 접근이 대응 기반 SfM 및 SLAM 방법을 능가할 수 있는가?
  • RQ2상대 자세를 확률적 다중 모드 분포로 모델링하면 직접 회귀 대비 연관 자세 일관성이 향상되는가?
  • RQ3학습 중에 볼 수 없었던 신규 물체 카테고리로 일반화 가능한가, 특히 대칭성이나 복잡한 외관을 가진 경우에 대해?
  • RQ4기존 SfM의 가정이 실패하는 변형 가능하거나 비정형 물체의 경우 시스템이 어떻게 대응하는가?
  • RQ5에너지 기반 공식화가 모호하거나 텍스처가 적은 시각 조건에서 강력한 추론을 가능하게 하는 정도는 어느 정도인가?

주요 결과

  • RelPose는 이미지 수가 20 미만일 경우를 포함해 희박한 이미지 세트에서 최신 SfM 및 SLAM 방법(예: DROID-SLAM, COLMAP)을 능가한다.
  • 학습 데이터에 포함되지 않은 새로운 물체 카테고리로 일반화되어, 훈련 데이터에 없던 카테고리의 신규 인스턴스에서도 뛰어난 성능을 달성한다.
  • 에너지 기반 학습을 통한 다중 모드 상대 자세 모델링은 직접 회귀보다 훨씬 더 일관된 연관 카메라 자세 추정을 가능하게 한다.
  • 시스템은 회전 대칭성을 성공적으로 포착한다 — 예를 들어 직사각형 물체의 경우 4개의 모드를 예측하거나 대칭 컵의 경우 2개의 모드를 예측함으로써 모호성에 대한 강건성을 입증한다.
  • 고양이나 소파와 같은 변형 가능한 물체의 경우에도 합리적이고 일관된 상대 자세 예측을 생성하여 외관 변화에 대한 내성성을 보여준다.
  • 정성적 결과에서는 시스템이 대칭 모드를 정확히 식별하고, 예를 들어 손잡이만 보일 때와 같이 모호한 경우에 잘못된 단일 모드 예측을 피하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.