Skip to main content
QUICK REVIEW

[논문 리뷰] 3D object reconstruction and 6D-pose estimation from 2D shape for robotic grasping of objects

Marcell Wolnitza, Osman Nafız Kaya|arXiv (Cornell University)|2022. 03. 02.
Robotics and Sensor-Based Localization인용 수 5
한 줄 요약

이 논문은 2차원 형태 매칭을 주요 단서로 사용하여 단일 또는 이중 RGB 이미지에서 6D 자세 추정 및 3D 물체 재구성 방법을 제시한다. 사전 훈련된 2D 세그멘테이션(ResNet50V2)을 활용하여 관측된 물체 실루엣을 3D 모델의 사전 계산된 2D 투영과 비교함으로써 카메라 좌표계 내에서 자세를 추정하고 3D 포인트 클라우드를 재구성한다. 이는 DOPE와 같은 최신 딥러닝 방법과 유사한 그립 성공률을 달성하며, 접시에서는 100% 성공률, 컵에서는 80% 성공률를 기록한다.

ABSTRACT

We propose a method for 3D object reconstruction and 6D-pose estimation from 2D images that uses knowledge about object shape as the primary key. In the proposed pipeline, recognition and labeling of objects in 2D images deliver 2D segment silhouettes that are compared with the 2D silhouettes of projections obtained from various views of a 3D model representing the recognized object class. By computing transformation parameters directly from the 2D images, the number of free parameters required during the registration process is reduced, making the approach feasible. Furthermore, 3D transformations and projective geometry are employed to arrive at a full 3D reconstruction of the object in camera space using a calibrated set up. Inclusion of a second camera allows resolving remaining ambiguities. The method is quantitatively evaluated using synthetic data and tested with real data, and additional results for the well-known Linemod data set are shown. In robot experiments, successful grasping of objects demonstrates its usability in real-world environments, and, where possible, a comparison with other methods is provided. The method is applicable to scenarios where 3D object models, e.g., CAD-models or point clouds, are available and precise pixel-wise segmentation maps of 2D images can be obtained. Different from other methods, the method does not use 3D depth for training, widening the domain of application.

연구 동기 및 목표

  • 3D 깊이 데이터나 훈련을 위한 6D 자세 애너테이션 없이도 2D RGB 이미지에서 정확한 3D 물체 재구성과 6D 자세 추정을 가능하게 하기 위해.
  • 색상이나 텍스처에 관계없이 2D 형태와 실루엣을 유일한 단서로 사용하여 자세와 구조 추정을 수행하는 방법을 개발하기 위해.
  • 캘리브레이션된 단일 또는 이중 카메라 설정과 실제 3D 물체 모델을 사용하여 실세계 로봇 그립에의 적용 가능성을 입증하기 위해.
  • 재현 가능성과 벤치마킹을 위해 다중 시점 이미지, 3D 모델, 카메라 파라미터를 포함한 데이터 세트를 제공하기 위해.
  • 3D 데이터나 복잡한 6D 자세 감시에 대한 의존도를 줄이기 위해 레이블링된 2D 세그멘테이션 마스크만을 사용하기 위해.

제안 방법

  • 딥러닝 기반의 ResNet50V2 모델이 2D RGB 이미지에서 개체 세그멘테이션과 분류를 수행하여 정밀한 2D 물체 실루엣을 추출한다.
  • CAD 또는 3D 스캔에서 유래한 3D 물체 모델의 사전 계산된 2D 실루엣을 다양한 시점에서 생성하여 기준 데이터베이스를 구성한다.
  • 관측된 2D 실루엣을 기하학적 유사도 측정 기준으로 3D 모델 데이터베이스의 가장 가까운 2D 투영과 매칭한다.
  • 변환 매개변수(회전 및 이동)는 2D 대응 관계에서 직접 추정되어 정렬 과정의 자유도 수를 감소시킨다.
  • 추정된 6D 자세를 3D 모델 포인트 클라우드에 적용하여 校정된 내재 및 외재 파라미터를 사용해 카메라 좌표계로 변환함으로써 3D 재구성을 달성한다.
  • 대칭 또는 반복적인 물체 구조로 인한 자세의 다의성을 해결하기 위해 두 번째 카메라를 사용한다.

실험 결과

연구 질문

  • RQ1실세계 로봇 환경에서 2D 물체 실루엣만으로도 정확한 6D 자세 추정 및 3D 재구성을 위한 충분한 정보를 제공할 수 있는가?
  • RQ2전통적인 형태 기반 접근 방식이 3D 감시나 복잡한 특징 학습에 의존하는 딥러닝 방법보다 또는 그와 동등하게 성능을 낼 수 있는가?
  • RQ3박스나 숟가락과 같은 얇거나 대칭적인 구조를 가진 물체와 같은 도전적인 기하학적 형태에서 이 방법의 성능은 어떠한가?
  • RQ43D 깊이 데이터나 6D 자세 애너테이션 없이 레이블링된 2D 세그멘테이션 마스크와 3D 모델 사전 지식만을 사용하여 높은 그립 성공률를 달성할 수 있는가?
  • RQ5두 번째 카메라의 포함이 대칭적이거나 다의적인 물체에 대해 자세 추정의 정확도를 얼마나 향상시키는가?

주요 결과

  • 접시 물체의 그립 실험에서 100% 성공률를 기록하였고, 컵은 80%, botle는 90%의 성공률를 달성하였다.
  • 얇고 긴 구조를 가진 숟가락은 40%의 성공률를 기록하였으며, 이는 DOPE를 사용한 YCB 수프 통의 58.3% 성공률와 유사한 수준이다.
  • 병, 상자, 컵, 접시에 대해 합성 데이터에서 90~100%의 성공률를 기록하였고, 상자는 넓은 형태로 인해 실제 테스트에서 약간 덜 성공하였다.
  • 3D 감시를 사용하는 최신 기술인 DOPE와 유사한 성능을 보였으며, 훈련은 오직 2D 세그멘테이션 마스크만을 사용하였다.
  • 이 방법은 Linemod 데이터 세트에 성공적으로 적용되었으며, 자세 추정 모듈이 PoseCNN과 비교 가능함을 입증하여 일반화 능력을 입증하였다.
  • 저자들은 다중 시점 이미지, 3D 모델, 카메라 파라미터를 포함한 새로운 데이터 세트를 공개하여 재현 가능성과 향후 벤치마킹을 지원하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.