Skip to main content
QUICK REVIEW

[논문 리뷰] ZeroPose: CAD-Prompted Zero-shot Object 6D Pose Estimation in Cluttered Scenes

Jianqiu Chen, Zhou, Zikun|arXiv (Cornell University)|2023. 05. 29.
Image and Object Detection Techniques인용 수 4
한 줄 요약

ZeroPose는 CAD 모델과 시각 기반 모델(SAM 및 ImageBind)을 활용하여 미사전 학습된 비객체에 대해 완전히 제로샷 6자리 물체 자세 추정 파이프라인을 제안한다. 이는 새로운 물체에 대한 훈련 없이도 인스턴스 수준의 세그멘테이션과 자세 추정을 수행한다. BOP 벤치마크에서 25.0%의 평균 평균 회수(AR)를 기록하며, 기존 방법 중 Megapose보다 8.6% 높은 성능을 달성하면서도 높은 효율성을 유지한다.

ABSTRACT

Many robotics and industry applications have a high demand for the capability to estimate the 6D pose of novel objects from the cluttered scene. However, existing classic pose estimation methods are object-specific, which can only handle the specific objects seen during training. When applied to a novel object, these methods necessitate a cumbersome onboarding process, which involves extensive dataset preparation and model retraining. The extensive duration and resource consumption of onboarding limit their practicality in real-world applications. In this paper, we introduce ZeroPose, a novel zero-shot framework that performs pose estimation following a Discovery-Orientation-Registration (DOR) inference pipeline. This framework generalizes to novel objects without requiring model retraining. Given the CAD model of a novel object, ZeroPose enables in seconds onboarding time to extract visual and geometric embeddings from the CAD model as a prompt. With the prompting of the above embeddings, DOR can discover all related instances and estimate their 6D poses without additional human interaction or presupposing scene conditions. Compared with existing zero-shot methods solved by the render-and-compare paradigm, the DOR pipeline formulates the object pose estimation into a feature-matching problem, which avoids time-consuming online rendering and improves efficiency. Experimental results on the seven datasets show that ZeroPose as a zero-shot method achieves comparable performance with object-specific training methods and outperforms the state-of-the-art zero-shot method with 50x inference speed improvement.

연구 동기 및 목표

  • 산업용 로봇 및 AR 응용 분야에서 새로운 물체에 적용할 때 기존 자세 추정 방법의 확장성과 높은 훈련 비용 문제를 해결하기 위해.
  • 사전 조정 또는 재학습 없이도 CAD 모델만을 입력으로 사용하여 새로운 물체에 대해 정확한 6자리 자세 추정을 가능하게 하기 위해.
  • 시각적 및 기하학적 사전 지식을 활용하여 제로샷 인스턴스 세그멘테이션과 제로샷 자세 추정을 수행하는 이중 단계 파이프라인을 개발하기 위해.
  • 렌더링된 자세 가설 생성이나 감독 기반 인스턴스 검출이 필요 없도록 하여 혼잡한 환경에서도 효율성과 강인성을 향상시키기 위해.
  • 실세계 상황에서 다양한 새로운 물체에 대해 일반화 가능한 완전한 제로샷 프레임워크를 구축하기 위해.

제안 방법

  • 이중 단계 파이프라인: 첫 번째 단계에서는 SAM을 사용해 후보 마스크를 생성하고, ImageBind를 활용해 렌더링된 CAD 뷰에서 시각적 임베딩을 추출하여 매칭한다.
  • 후보 이미지 특징과 사전 추출된 CAD 모델 특징 간의 코사인 유사도를 통한 시각적 서술자 매칭을 통해 세그멘테이션된 인스턴스에 객체 ID를 할당한다.
  • 장면의 3D 포인트 클러스터를 CAD 모델의 3D 기하학 구조와 직접 매칭하는 경량의 계층적 기하학적 구조 매칭 모듈을 통해 6자리 자세를 추정한다.
  • 노이즈가 많은 포인트를 물체 반경 임계값을 활용해 필터링한 후, RANSAC 기반의 ICP 유사 매칭을 통해 3D-3D 포인트 대응을 이용해 자세를 추정한다.
  • 모델의 사전 조정 없이 추론 시간에만 작동하며, CAD 모델과 시각 기반 모델 외에는 추가 학습이 필요하지 않다.
  • 파이프라인은 PyTorch 스타일의 의사코드로 구현되었으며, CAD 모델 포인트의 균일한 샘플링과 깊이 투영을 통해 장면의 포인트 클러스터를 생성한다.

실험 결과

연구 질문

  • RQ1CAD 모델 기반의 제로샷 자세 추정 파이프라인이 새로운 물체에 대한 훈련 없이도 높은 정확도를 달성할 수 있는가?
  • RQ2SAM 및 ImageBind와 같은 시각 기반 모델을 효과적으로 조합하여 새로운 물체의 제로샷 인스턴스 세그멘테이션을 가능하게 할 수 있는가?
  • RQ3정확도와 효율성 측면에서 렌더링 기반 2D-2D 대응 방법에 비해 직접적인 3D-3D 기하학적 구조 매칭이 우월한가?
  • RQ4혼잡한 환경 조건에서 Megapose와 같은 최신 기술 수준의 방법과 비교해 본다면, 제안된 방법은 제로샷 자세 추정에서 어떤 성능을 보이는가?
  • RQ5BOP 벤치마크 데이터셋에서 다양한 새로운 물체에 대해 파이프라인이 높은 성능을 유지할 수 있는가?

주요 결과

  • 제안된 제로샷 인스턴스 세그멘테이션 방법은 감독 기반 MaskRCNN와 유사한 성능을 기록하였으며, BOP 벤치마크에서 17.7%의 평균 평균 회수(AR)를 달성했다.
  • 제로샷 자세 추정기의 평균 AR은 BOP 코어 7개 데이터셋에서 25.0%로 나타났으며, Megapose보다 8.6% 높은 성능을 기록했다.
  • LM-O 및 T-LESS 데이터셋에서는 포인트 클러스터의 신호 대 잡음 비율이 낮아 기하학적 구조가 노이즈가 많고 정확도가 떨어지는 경향이 있었다.
  • 메가포즈가 온라인 렌더링과 매칭에 의존하는 것과 달리, 자세 가설 생성을 회피함으로써 뛰어난 효율성을 입증했다.
  • 실시간 산업 응용에 적합한 빠른 추론 성능을 유지하면서도 제로샷 자세 추정 분야에서 최신 기술 수준의 결과를 달성했다.
  • 시각 기반 모델과 CAD 기하학의 통합은 다양한 새로운 물체에 대해 강인하고 일반화 가능한 자세 추정을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.