Skip to main content
QUICK REVIEW

[논문 리뷰] FS-Net: Fast Shape-based Network for Category-Level 6D Object Pose Estimation with Decoupled Rotation Mechanism

Wei Chen, Xi Jia|arXiv (Cornell University)|2021. 03. 12.
Robot Manipulation and Learning참고 문헌 42인용 수 9
한 줄 요약

FS-Net는 단일 RGB-D 이미지를 사용하여 카테고리 수준의 6자리 물체 자세 추정을 위한 빠르고 형태 기반의 딥 네트워크를 제안한다. 이는 3D 그래프 컨volution 오토에인코더를 활용해 회전 불변 특징을 학습하고, 분리된 회전 메커니즘을 통해 정확도와 강인성을 향상시킨다. 합성 데이터 없이도 NOCS-REAL에서 6.3%의 정확도 향상을 달성하며, 추론 속도는 20 FPS를 기록하여 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In this paper, we focus on category-level 6D pose and size estimation from monocular RGB-D image. Previous methods suffer from inefficient category-level pose feature extraction which leads to low accuracy and inference speed. To tackle this problem, we propose a fast shape-based network (FS-Net) with efficient category-level feature extraction for 6D pose estimation. First, we design an orientation aware autoencoder with 3D graph convolution for latent feature extraction. The learned latent feature is insensitive to point shift and object size thanks to the shift and scale-invariance properties of the 3D graph convolution. Then, to efficiently decode category-level rotation information from the latent feature, we propose a novel decoupled rotation mechanism that employs two decoders to complementarily access the rotation information. Meanwhile, we estimate translation and size by two residuals, which are the difference between the mean of object points and ground truth translation, and the difference between the mean size of the category and ground truth size, respectively. Finally, to increase the generalization ability of FS-Net, we propose an online box-cage based 3D deformation mechanism to augment the training data. Extensive experiments on two benchmark datasets show that the proposed method achieves state-of-the-art performance in both category- and instance-level 6D object pose estimation. Especially in category-level pose estimation, without extra synthetic data, our method outperforms existing methods by 6.3% on the NOCS-REAL dataset.

연구 동기 및 목표

  • 비효율적인 특징 추출으로 인한 낮은 정확도와 느린 추론 속도 문제를 해결하기 위해 카테고리 수준의 6자리 자세 추정에 도전한다.
  • 색상 변화에 민감도를 낮추기 위해 RGB 기반 방법의 한계를 극복하기 위해 형태 특징에 중점을 둔다.
  • 제한된 훈련 데이터 하에서 일반화 능력을 향상시키기 위해 새로운 3D 데이터 증강 전략을 도입한다.
  • 원형 대칭 및 축 대칭을 처리할 수 있는 회전 표현을 통해 대칭 물체에 대한 강인한 추정을 가능하게 한다.
  • 소비자용 GPU 하드웨어에서 20 FPS 추론 속도를 달성할 수 있는 빠르고 실시간 동작이 가능한 시스템을 설계한다.

제안 방법

  • 깊이 이미지에서 추출한 점군으로부터 방향 인식 가능하고, 이동 및 스케일 불변인 잠재 특징을 학습하기 위해 3D 그래프 컨볼루션(3DGC) 오토에인코더를 활용한다.
  • 학습된 잠재 특징에서 회전을 추정하기 위해 상호 보완적인 두 개의 디코더를 사용하는 분리된 회전 메커니즘을 도입하여 대칭에 대한 강인성을 향상시킨다.
  • 평균 물체 좌표/크기와 진짜값 간의 차이를 예측하는 잔차 신경망을 통해 이동 및 크기를 추정한다.
  • 실제 형태 변화를 시뮬레이션하기 위해 온라인 박스케이지 기반 3D 변형 메커니즘을 제안하여 훈련 데이터를 증강한다.
  • YOLOv3를 사용해 2D 물체 검출을 수행하여 RGB-D 입력으로부터 거친 3D 점군을 추출하고, 이후 네트워크 입력을 위해 3D 구 영역 자르기를 수행한다.
  • 벡터 기반의 회전 표현을 적용하고, 회전군 분석 및 거리 최소화를 통해 다양한 대칭 유형(예: 이축 대칭, N축 대칭)을 처리할 수 있도록 확장한다.

실험 결과

연구 질문

  • RQ1효율적인 카테고리 수준의 특징 추출을 갖춘 형태 기반 네트워크가 기존의 RGB 또는 RGB-D 융합 방법보다 6자리 자세 추정에서 우월한 성능을 낼 수 있는가?
  • RQ2분리된 회전 메커니즘을 통해 대칭 물체에서의 회전 모호성을 효과적으로 해결할 수 있는가?
  • RQ3온라인 3D 데이터 증강이 제한된 데이터 환경에서 카테고리 수준의 자세 추정에 일반화 능력을 얼마나 향상시키는가?
  • RQ43DGC 오토에인코더가 물체 크기 및 점 이동에 민감하지 않은 강인한 불변 특징을 학습할 수 있는가?
  • RQ5카테고리 수준의 6자리 자세 추정에서 추론 속도와 정확도 사이의 상충 관계는 어떻게 되며, 실시간 성능를 달성할 수 있는가?

주요 결과

  • FS-Net는 합성 데이터 없이도 NOCS-REAL 데이터셋에서 기존 방법보다 6.3% 높은 정확도를 달성하여 카테고리 수준의 6자리 자세 추정에서 최신 기술 수준의 성능을 확보했다.
  • GTX 1080 Ti GPU에서 20 FPS로 실행되어 실시간 로봇 응용에 적합한 높은 추론 효율성을 입증했다.
  • 제안된 온라인 박스케이지 기반 3D 변형 메커니즘이 NOCS-REAL 데이터셋에서 자세 정확도를 7.7% 향상시켜 제한된 감독 하에서도 일반화 능력을 향상시켰다.
  • 분리된 회전 메커니즘은 원형 또는 축 대칭을 가진 물체를 효과적으로 처리할 수 있었으며, 회전군 분석을 통해 회전 모호성을 해결했다.
  • 정성적 결과에서 FS-Net는 색상 및 형태 변화에 더 강인하며, Shape-Prior가 실패하는 경우에도 정확한 자세를 추정하는 것으로 나타났다.
  • 3DGC 오토에인코더는 점 이동 및 스케일 변화에 민감하지 않은 잠재 특징을 학습하여 반복적 변화에 대해 일관된 특징 표현을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.