Skip to main content
QUICK REVIEW

[논문 리뷰] POPE: 6-DoF Promptable Pose Estimation of Any Object, in Any Scene, with One Reference

Zhiwen Fan, Panwang Pan|arXiv (Cornell University)|2023. 05. 25.
Robot Manipulation and Learning인용 수 4
한 줄 요약

POPE는 사전 훈련된 2D 기초 모델을 사용하여 단일 기준 이미지와 임의의 장면 내 어떤 대상 물체 간의 정확한 상대 자세 예측을 수행할 수 있는 제로샷 6-DoF 물체 자세 추정 프레임워크를 소개한다. 계층적 특징 표현, 3D 기하 원리, 그리고 군집에서 세분화되는 개선 파이프라인을 결합함으로써 POPE는 LINEMOD에서 52.38% 감소, OnePose에서 50.47% 감소한 중앙값 자세 오차를 기록하여, 최소한의 감독 정보로도 개방형 세계, 제로샷 환경에서 최고 수준의 강건성을 확보한다.

ABSTRACT

Despite the significant progress in six degrees-of-freedom (6DoF) object pose estimation, existing methods have limited applicability in real-world scenarios involving embodied agents and downstream 3D vision tasks. These limitations mainly come from the necessity of 3D models, closed-category detection, and a large number of densely annotated support views. To mitigate this issue, we propose a general paradigm for object pose estimation, called Promptable Object Pose Estimation (POPE). The proposed approach POPE enables zero-shot 6DoF object pose estimation for any target object in any scene, while only a single reference is adopted as the support view. To achieve this, POPE leverages the power of the pre-trained large-scale 2D foundation model, employs a framework with hierarchical feature representation and 3D geometry principles. Moreover, it estimates the relative camera pose between object prompts and the target object in new views, enabling both two-view and multi-view 6DoF pose estimation tasks. Comprehensive experimental results demonstrate that POPE exhibits unrivaled robust performance in zero-shot settings, by achieving a significant reduction in the averaged Median Pose Error by 52.38% and 50.47% on the LINEMOD and OnePose datasets, respectively. We also conduct more challenging testings in causally captured images (see Figure 1), which further demonstrates the robustness of POPE. Project page can be found with https://paulpanwang.github.io/POPE/.

연구 동기 및 목표

  • 모든 장면에서 사전에 보지 않은 물체에 대해 3D 모델이나 고밀도 애너테이션 없이 6-DoF 물체 자세 추정을 가능하게 하기.
  • 기존 방법들이 닫힌 카테고리 검출, CAD 모델, 또는 많은 수의 자세가 기록된 지원 뷰 세트에 의존하는 데서 비롯되는 한계를 극복하기.
  • 단일 기준 이미지만을 사용하여 다양한 물체 카테고리에 대해 일반화 가능한 제로샷, 개방형 세계 자세 추정 시스템을 개발하기.
  • 기존 2D-2D 매칭이 실패하는 혼잡한 배경, 부분 가림, 또는 자연스럽게 촬영된 장면에서의 강건성을 향상시키기.
  • 대규모 2D 기초 모델의 제로샷 일반화 능력을 활용하여 물체 검색 및 자세 추정을 수행하기.

제안 방법

  • POPE는 사전 훈련된 2D 기초 모델을 사용해 새로운 시야에서 물체의 세그먼테이션 후보를 생성함으로써 카테고리 제약 없이 개방형 세계 검출을 가능하게 한다.
  • 교차 어텐션 메커니즘을 통해 기준 이미지와 세그먼테이션 후보 간의 물체 수준 매칭을 수행함으로써, 새로운 물체의 제로샷 검색을 가능하게 한다.
  • 프레임워크는 거친 대응 기반 2D-2D 전역 매칭을 통해 상대 6-DoF 자세를 추정하고, 기하 제약 조건을 활용한 2D-3D 국소 매칭을 통해 결과를 정밀하게 보정한다.
  • 거친 단계에서 세분화되는 개선 파이프라인을 통해, 심한 가림이나 혼잡한 환경에서도 두 개 이상의 시야에서 정확한 자세 추정을 수행할 수 있다.
  • 계층적 특징 표현과 3D 기하 사전 지식을 통합하여 매칭의 안정성과 자세 정확도를 향상시킨다.
  • 심도 맵이나 사전 애너테이션된 3D 데이터가 필요 없이 이중 시야 및 다중 시야 자세 추정을 모두 지원한다.

실험 결과

연구 질문

  • RQ1단일 기준 이미지로 개방형 세계, 제로샷 환경에서 어떤 물체에 대해서도 정확한 6-DoF 자세 추정이 가능한가?
  • RQ2사전 훈련된 2D 기초 모델을 어떻게 활용하여 복잡한 장면에서 제로샷 물체 검색 및 상대 자세 추정을 수행할 수 있는가?
  • RQ3제로샷 환경에서 종단 간 또는 단일 단계 방법 대비 거친 단계에서 세분화되는 2D-2D 및 2D-3D 매칭 파이프라인의 성능 향상은 어느 정도인가?
  • RQ4혼잡한 배경, 가림, 또는 자연스럽게 촬영된 이미지 등 도전적인 실세계 시나리오에서 이 방법의 강건성은 어떠한가?
  • RQ5카테고리별 맞춤 보정 또는 3D 모델 없이도 다양한 물체 카테고리에 대해 일반화가 가능한가?

주요 결과

  • POPE는 제로샷 환경에서 기존 방법 대비 LINEMOD 데이터셋에서 52.38% 감소한 중앙값 자세 오차를 기록했으며, OnePose 데이터셋에서는 50.47% 감소했다.
  • OnePose++ 데이터셋에서 POPE는 중앙값 오차 6.273을 기록하여, 다음으로 우수한 방법인 LoFTR(9.012) 대비 42.2% 향상된 성능을 보였다.
  • 제로샷 이중 시야 자세 추정에서 POPE는 OnePose 데이터셋에서 30° 기준 96.2%의 정확도를 달성했으며, LoFTR(96.3%)와 Gen6D(89.3%)를 뛰어넘는 성능을 보였다.
  • LINEMOD 데이터셋에서 POPE는 15° 기준 91.1%의 정확도를 기록했으며, LoFTR(91.8%)와 Gen6D(89.3%)를 모두 초월했다.
  • POPE는 자연스럽게 촬영된 이미지와 혼잡한 장면에서도 강건성을 유지하며, 기존 방법이 실패하는 상황에서도 높은 정확도를 유지한다.
  • 다양한 질감과 물체 유형을 가진 여러 벤치마크 데이터셋에서 중앙값 오차 및 15°, 30° 기준 정확도 등 모든 지표에서 최고 성능을 기록하며, 최첨단 성능을 확보했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.