Skip to main content
QUICK REVIEW

[논문 리뷰] Category-Level 6D Object Pose Estimation via Cascaded Relation and Recurrent Reconstruction Networks

Jiaze Wang, Kai Chen|arXiv (Cornell University)|2021. 08. 19.
Robot Manipulation and Learning인용 수 7
한 줄 요약

이 논문은 RGB 이미지, 포인트 클라우드, 그리고 카테고리 형태 사전 지식을 활용하여 NOCS 공간 내에서 표준 3D 모델을 재구성하는 계단식 관계 및 반복적 재구성 네트워크를 제안한다. 제안된 방법은 기존 SOTA 방법 대비 엄격한 $3D_{75}$ 및 $5^\circ2cm$ 평가 기준에서 각각 4.9% 및 17.7% 향상된 mAP 성능을 달성하여 최신 기준 성능을 확립한다.

ABSTRACT

Category-level 6D pose estimation, aiming to predict the location and orientation of unseen object instances, is fundamental to many scenarios such as robotic manipulation and augmented reality, yet still remains unsolved. Precisely recovering instance 3D model in the canonical space and accurately matching it with the observation is an essential point when estimating 6D pose for unseen objects. In this paper, we achieve accurate category-level 6D pose estimation via cascaded relation and recurrent reconstruction networks. Specifically, a novel cascaded relation network is dedicated for advanced representation learning to explore the complex and informative relations among instance RGB image, instance point cloud and category shape prior. Furthermore, we design a recurrent reconstruction network for iterative residual refinement to progressively improve the reconstruction and correspondence estimations from coarse to fine. Finally, the instance 6D pose is obtained leveraging the estimated dense correspondences between the instance point cloud and the reconstructed 3D model in the canonical space. We have conducted extensive experiments on two well-acknowledged benchmarks of category-level 6D pose estimation, with significant performance improvement over existing approaches. On the representatively strict evaluation metrics of $3D_{75}$ and $5^{\circ}2 cm$, our method exceeds the latest state-of-the-art SPD by $4.9\%$ and $17.7\%$ on the CAMERA25 dataset, and by $2.7\%$ and $8.5\%$ on the REAL275 dataset. Codes are available at https://wangjiaze.cn/projects/6DPoseEstimation.html.

연구 동기 및 목표

  • 새로운 카테고리 내에서 CAD 모델을 요구하지 않고도 미리 보지 않은 물체 인스턴스에 대한 6자리 자세 추정 문제를 해결하기 위해.
  • RGB 이미지, 포인트 클라우드, 카테고리 사전 지식 간의 복잡한 관계를 모델링하여 NOCS 공간 내 표준 3D 모델 재구성 정확도를 향상시키기 위해.
  • 거친 단계에서 정교한 단계로의 반복적 정밀 조정을 통해 3D 모델 재구성을 개선하여 자세 추정 정확도를 향상시키기 위해.
  • 카테고리 수준의 6자리 자세 추정에서 내부 클래스 형태 변동성과 공간적으로 편향된 특징 학습 문제를 극복하기 위해.
  • 실제 로봇 조작 및 증강 현실 응용 분야에 적합한 견고한 프레임워크를 구축하기 위해.

제안 방법

  • 이식체 RGB 이미지와 포인트 클라우드 간의 다중 모odal 관계를 모델링하기 위해 계단식 관계 네트워크를 설계하여 특징 표현을 향상시킨다.
  • 이식체 특징과 카테고리 형태 사전 지식 간의 관계를 캡처하기 위해 카테고리 관계 네트워크를 설계하여 내부 클래스 형태 변동성을 모델링한다.
  • 반복 잔차 보정을 수행하는 반복적 재구성 네트워크가 NOCS 공간 내 3D 모델 재구성 정확도를 점진적으로 향상시킨다.
  • 재구성된 표준 3D 모델을 사용하여 관측된 이식체 포인트 클라우드와 밀도 높은 대응 관계를 수립함으로써 6자리 자세 추정을 수행한다.
  • CAMERA25와 REAL275를 조합한 하이브리드 데이터셋을 기반으로 엔드 투 엔드로 프레임워크를 훈련하며, 카테고리당 단지 3개의 훈련 인스턴스만을 사용한다.
  • 동일한 카테고리 내 이식체 간 척도와 방향을 통일하기 위해 정규화된 물체 좌표 공간(NOCS)을 활용한다.

실험 결과

연구 질문

  • RQ1RGB 이미지와 포인트 클라우드 간의 다중 모달 관계를 효과적으로 모델링하면 카테고리 수준 설정에서 6자리 자세 추정 성능이 어떻게 향상될 수 있는가?
  • RQ2카테고리 수준의 형태 사전 지식을 통해 내부 클래스 형태 변동성을 얼마나 줄일 수 있으며, 표준 3D 모델 재구성 정확도는 어떻게 향상될 수 있는가?
  • RQ3반복적 보정이 거친 단계에서 정교한 단계로의 방식으로 3D 모델 재구성 정확도와 그에 따른 6자리 자세 추정 정확도를 향상시킬 수 있는가?
  • RQ4엄격한 평가 기준인 $3D_{75}$ 및 $5^\circ2cm$ 기준에서 제안된 방법은 최신 기준 방법들과 비교해 어떻게 성능을 내는가?
  • RQ5계단식 관계 및 반복적 재구성 네트워크 각각의 구성 요소가 전체 성능 향상에 기여하는 정도는 어떠한가?

주요 결과

  • CAMERA25 벤치마크에서 $3D_{75}$ 평가 기준에서 이전 SOTA인 SPD 대비 4.9% 향상된 mAP 55.9%를 달성하여 3D IoU 75% 기준으로 최고 성능을 기록했다.
  • 동일한 데이터셋에서 $5^\circ2cm$ 자세 오차 기준에서 mAP가 SPD 대비 17.7% 향상되어 더 높은 성능을 확보했다.
  • REAL275 벤치마크에서 $5^\circ2cm$ 오차 기준 mAP는 27.8%를 기록하여 SPD 대비 8.5% 향상된 성과를 보였다.
  • CAMERA25와 REAL275 양쪽 데이터셋에서 모든 카테고리에서 재구성된 NOCS 모델의 캐미언 디스턴스(CD)가 SPD보다 일관되게 낮아, 더 뛰어난 형태 재구성 능력을 보였다.
  • 제거 실험 결과, 장거리 및 다중 모달 관계를 모델링하는 데에서 트랜스포머 기반 관계 모듈이 MLP 및 Non-Local 네트워크보다 뛰어난 성능을 보였다.
  • 두 번의 반복 단계를 사용할 경우, CAMERA25에서 $5^\circ2cm$ 기준 mAP가 4.7% 향상되었고, REAL275에서는 4.0% 향상되어 반복적 정밀 조정의 효과를 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.