Skip to main content
QUICK REVIEW

[논문 리뷰] G2L-Net: Global to Local Network for Real-time 6D Pose Estimation with Embedding Vector Features

Wei Chen, Xi Jia|arXiv (Cornell University)|2020. 03. 24.
Robot Manipulation and Learning참고 문헌 46인용 수 9
한 줄 요약

G2L-Net는 RGB-D 데이터를 기반으로 하는 실시간 6자리 물체 자세 추정 프레임워크로, 전역에서 국소로의 파이프라인을 사용하며, 압축된 3차원 검색을 위해 3차원 구를 활용하고, 시점에 민감한 정보를 포착하기 위해 점별 임bedding 벡터 특징(EVF)을 도입하며, 자세 예측의 정확도를 향상시키기 위해 회전 잔차 추정기를 사용한다. 이는 최신 기술 수준의 정확도와 속도를 달성하며, GTX 1080 Ti에서 23 fps로 작동하여 LINEMOD 및 YCB-Video 데이터셋에서 이전의 깊이 기반 방법들을 능가한다.

ABSTRACT

In this paper, we propose a novel real-time 6D object pose estimation framework, named G2L-Net. Our network operates on point clouds from RGB-D detection in a divide-and-conquer fashion. Specifically, our network consists of three steps. First, we extract the coarse object point cloud from the RGB-D image by 2D detection. Second, we feed the coarse object point cloud to a translation localization network to perform 3D segmentation and object translation prediction. Third, via the predicted segmentation and translation, we transfer the fine object point cloud into a local canonical coordinate, in which we train a rotation localization network to estimate initial object rotation. In the third step, we define point-wise embedding vector features to capture viewpoint-aware information. To calculate more accurate rotation, we adopt a rotation residual estimator to estimate the residual between initial rotation and ground truth, which can boost initial pose estimation performance. Our proposed G2L-Net is real-time despite the fact multiple steps are stacked via the proposed coarse-to-fine framework. Extensive experiments on two benchmark datasets show that G2L-Net achieves state-of-the-art performance in terms of both accuracy and speed.

연구 동기 및 목표

  • 복잡한 환경에서 깊이 정보를 활용한 실시간 정확한 6자리 물체 자세 추정을 달성하는 데 도전한다.
  • 조명 변화와 가림 현상에 민감한 RGB만을 사용하는 기존 방법의 한계를 극복한다.
  • 새로운 특징 표현 방식을 통해 시점 정보를 보다 효과적으로 활용하여 깊이 기반 자세 추정을 향상시킨다.
  • 추론 속도를 저하시키지 않으면서도 잔차 추정 전략을 사용하여 회전 정확도를 향상시킨다.

제안 방법

  • 물체 포인트 클라우드의 국소화를 위해 프리즘 대신 3차원 구를 사용하여 3차원 검색 공간을 더 압축된 영역으로 줄인다.
  • 번역 국소화 네트워크는 3차원 세그먼테이션을 수행하고 굵은 포인트 클라우드에서 물체의 번역을 추정한다.
  • 세그먼테이션 및 번역된 포인트 클라우드는 시점에 민감한 특징 학습을 향상시키기 위해 국소 캐논리컬 좌표계로 변환된다.
  • 점별 임베딩 벡터 특징(EVF)이 도입되어 물체의 각 점에서 세밀한 시점 의존 정보를 포착한다.
  • 초기 자세 예측의 정확도를 향상시키기 위해 예측된 회전과 진짜 회전 간의 차이를 학습하는 데 회전 잔차 추정기를 적용한다.
  • 전체 파이프라인은 실시간 추론을 최적화하여 단일 GPU에서 20 fps 이상을 달성한다.

실험 결과

연구 질문

  • RQ1RGB-D 데이터를 사용한 6자리 물체 자세 추정에서 전역에서 국소로의 네트워크 설계가 정확도와 속도를 동시에 향상시킬 수 있는가?
  • RQ2전역 점 특징에 비해 점별 임베딩 벡터 특징(EVF)이 시점에 민감한 정보를 얼마나 효과적으로 포착할 수 있는가?
  • RQ3잔차 추정 전략을 사용할 경우, 추론 속도를 저하시키지 않으면서도 회전 정확도를 크게 향상시킬 수 있는가?
  • RQ4기존의 프리즘 기반 방법에 비해 3차원 구 기반의 물체 국소화 방식은 어떤가? 특히 압축성과 성능 측면에서 어떻게 비교되는가?
  • RQ5YCB-Video 데이터셋과 같은 다중 물체 시나리오에서도 제안된 방법이 높은 정확도를 유지할 수 있는가?

주요 결과

  • LINEMOD 데이터셋에서 G2L-Net은 평균 ADD 정확도 93.0%를 달성하여 기준 모델인 Frustum-P보다 5.4% 높고, 두 번째로 우수한 깊이 기반 방법보다 2.4% 높다.
  • LINEMOD 데이터셋에서 G2L-Net는 21 fps로 작동하며, 두 번째로 우수한 깊이 기반 방법보다 약 3배 빠르다.
  • YCB-Video 데이터셋에서 G2L-Net는 AUC 정확도 92.4%를 달성하여 최고 성능을 보인 방법과 동일한 성능을 내지만, 21 fps로 가장 빠른 속도를 기록했다.
  • 회전 잔차 추정기는 특히 복잡한 형태이거나 낮은 무늬를 가진 물체에서 정확도 향상에 크게 기여한다.
  • GTX 1080 Ti GPU에서 G2L-Net는 23 fps로 작동하며, 2D 검출에 11ms, 자세 추정에 32ms가 소요되어 실시간 성능을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.