Skip to main content
QUICK REVIEW

[논문 리뷰] MegaPose: 6D Pose Estimation of Novel Objects via Render & Compare

Yann Labbé, Lucas Manuelli|arXiv (Cornell University)|2022. 12. 13.
Robot Manipulation and Learning인용 수 68
한 줄 요약

MegaPose는 추론 시에 렌더링-대비 정제 파이프라인과 새로운 거칠은 포즈 추정기를 사용하여 대규모 합성 데이터 세트로 학습된 novel objects의 6D 포즈를 추정하며, ModelNet에서 최첨단 결과를 달성하고 BOP에서 객체별 훈련 없이도 경쟁력 있는 결과를 달성합니다.

ABSTRACT

We introduce MegaPose, a method to estimate the 6D pose of novel objects, that is, objects unseen during training. At inference time, the method only assumes knowledge of (i) a region of interest displaying the object in the image and (ii) a CAD model of the observed object. The contributions of this work are threefold. First, we present a 6D pose refiner based on a render&compare strategy which can be applied to novel objects. The shape and coordinate system of the novel object are provided as inputs to the network by rendering multiple synthetic views of the object's CAD model. Second, we introduce a novel approach for coarse pose estimation which leverages a network trained to classify whether the pose error between a synthetic rendering and an observed image of the same object can be corrected by the refiner. Third, we introduce a large-scale synthetic dataset of photorealistic images of thousands of objects with diverse visual and shape properties and show that this diversity is crucial to obtain good generalization performance on novel objects. We train our approach on this large synthetic dataset and apply it without retraining to hundreds of novel objects in real images from several pose estimation benchmarks. Our approach achieves state-of-the-art performance on the ModelNet and YCB-Video datasets. An extensive evaluation on the 7 core datasets of the BOP challenge demonstrates that our approach achieves performance competitive with existing approaches that require access to the target objects during training. Code, dataset and trained models are available on the project page: https://megapose6d.github.io/.

연구 동기 및 목표

  • CAD 모델과 관심 영역 이미지 하나로 새로운 물체의 6D 포즈 추정 가능하도록 한다.
  • 훈련 중 객체별 대칭 지식 없이 작동하는 거친 포즈 추정기를 개발한다.
  • 여러 합성 뷰를 렌더링하여 보이지 않는 물체에 일반화할 수 있는 정제 네트워크를 설계한다.
  • 새로운 물체에 대한 일반화를 향상시키기 위해 대규모 합성 데이터세트를 활용한다.
  • ModelNet 및 BOP 데이터셋에서 평가하여 최첨단 또는 경쟁력 있는 성능을 입증한다.

제안 방법

  • 관찰된 이미지와 가장 호환되는 렌더링 뷰를 선택하는 분류 모델을 통한 거친 포즈 추정으로 대칭성 처리를 가능하게 한다.
  • 초기 포즈를 주면 기준점을 가진 다중 뷰를 렌더링하고 해석 가능한 회전/병진 형식으로 포즈 업데이트를 예측하는 포즈 정제 네트워크.
  • 앵커 포인트를 이미지 중심에 투사하고 여러 시점 뷰를 사용하여 위치를 추론하는 앵커 포인트 처리로 새로운 물체에 일반화 가능하게 한다.
  • 입력은 RGB 또는 RGB-D 가능하며, ResNet-34 백본 다음 거친 모델은 하나의 완전 연결층, 정제기는 9차원 출력을 가진다.
  • ShapeNet과 Google Scanned Objects에서 생성된 대규모 합성 데이터셋(2백만 이미지)을 이용한 학습으로 데이터 증강 및 깊이/법선 채널을 통해 현실감과 가림에 대한 강건성을 향상시킨다.
  • 깊이/법선 채널이 포함되며 깊이 입력은 물체 간 스케일 일반화를 돕도록 정규화된다.

실험 결과

연구 질문

  • RQ16D 포즈 추정기가 합성 데이터 및 렌더링-대비 정제를 사용하여 학습되지 않은 새로운 물체에 일반화하도록 훈련될 수 있는가?
  • RQ2명시적인 대칭 정보 없이 학습된 거친 포즈 추정기가 새 객체에 대한 정제를 효과적으로 초기화할 수 있는가?
  • RQ3대규모 합성 데이터가 다양한 벤치마크를 넘어 새로운 물체 인스턴스에 대한 일반화에 어떤 영향을 미치는가?
  • RQ4테스트 시점에 객체가 새로운 경우에도 모델MegaPose가 표준 6D 포즈 벤치마크(ModelNet, YCB-Video, 그리고 일곱 개의 BOP core 데이터셋)에서 어떤 성능을 보이는가?

주요 결과

  • 거친 + 정제기 파이프라인은 초기 포즈 추정을 크게 향상시키고 대상 객체에 대한 학습 없이도 여러 벤치마크에서 경쟁력 있거나 우수한 결과를 달성한다.
  • MegaPose의 RGB-D 변형은 Zephyr와 같은 이전 방법과 비교하여 YCB-V 및 LM-O에서 현저한 AR 향상을 보이며 벤치마크 쌍에서 평균 개선이 보고되었다.
  • 정제기가 상당한 이득(+41.0 AR on RGB-D)을 제공하고 RTX 2080에서 각 반복당 약 50 ms로 작동하여 거의 실시간 정제가 가능하다.
  • 대규모의 다양하고 합성된 데이터셋으로 학습하면 새로운 물체에 대한 일반화가 크게 향상되며, 학습 물체의 수와 다양성이 증가할수록 성능이 향상되는 연구 결과가 포함된다.
  • ModelNet에서 MegaPose 정제기는 MP-AAE 및 LatentFusion과 같은 최첨단 방법을 여러 지표에서 능가한다.
  • 일곱 개의 BOP core 데이터셋에서 MegaPose는 타깃 객체를 학습 시점에 사용할 필요가 있는 방법들과 경쟁력 있게 강한 성능을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.