Skip to main content
QUICK REVIEW

[논문 리뷰] Stereo Vision Based Single-Shot 6D Object Pose Estimation for Bin-Picking by a Robot Manipulator

Yoshihiro Nakano|arXiv (Cornell University)|2020. 05. 28.
Robot Manipulation and Learning참고 문헌 28인용 수 4
한 줄 요약

이 논문은 단일 영상에서 6자리 물체 자세 추정을 가능하게 하는 스테레오 비전 기반의 로봇 박스픽킹 방법을 제안한다. 새로운 스테레오 그리드 어텐션 모듈을 통해 정밀한 디스parity 계산을 검출된 물체에만 집중시켜 빠르고 정확한 자세 추정을 실현한다. 이 방법은 Jetson AGX Xavier에서 1024×1024 해상도 이미지를 75ms 내로 처리하며, 합성 데이터와 실제 환경 테스트를 통해 전자석 그립퍼를 사용해 89.1%의 성공률을 기록했다.

ABSTRACT

We propose a fast and accurate method of 6D object pose estimation for bin-picking of mechanical parts by a robot manipulator. We extend the single-shot approach to stereo vision by application of attention architecture. Our convolutional neural network model regresses to object locations and rotations from either a left image or a right image without depth information. Then, a stereo feature matching module, designated as Stereo Grid Attention, generates stereo grid matching maps. The important point of our method is only to calculate disparity of the objects found by the attention from stereo images, instead of calculating a point cloud over the entire image. The disparity value is then used to calculate the depth to the objects by the principle of triangulation. Our method also achieves a rapid processing speed of pose estimation by the single-shot architecture and it is possible to process a 1024 x 1024 pixels image in 75 milliseconds on the Jetson AGX Xavier implemented with half-float model. Weakly textured mechanical parts are used to exemplify the method. First, we create original synthetic datasets for training and evaluating of the proposed model. This dataset is created by capturing and rendering numerous 3D models of several types of mechanical parts in virtual space. Finally, we use a robotic manipulator with an electromagnetic gripper to pick up the mechanical parts in a cluttered state to verify the validity of our method in an actual scene. When a raw stereo image is used by the proposed method from our stereo camera to detect black steel screws, stainless screws, and DC motor parts, i.e., cases, rotor cores and commutator caps, the bin-picking tasks are successful with 76.3%, 64.0%, 50.5%, 89.1% and 64.2% probability, respectively.

연구 동기 및 목표

  • 혼잡한 박스픽킹 환경에서 스테레오 비전을 활용해 빠르고 정확한 6자리 물체 자세 추정을 가능하게 하기 위해.
  • 전체 이미지가 아닌 검출된 물체에만 디스파리 계산을 집중시켜 계산 비용을 줄이기 위해.
  • 깊이 입력 없이도 왼쪽 또는 오른쪽 스테레오 이미지에서 6자리 자세를 직접 회귀하는 단일 스텝 딥 러닝 프레임워크를 개발하기 위해.
  • 합성 데이터셋을 활용해 약한 무늬를 가진 기계 부품에 대해 실제 로봇 조작 환경에서의 성능을 검증하기 위해.
  • Jetson AGX Xavier와 같은 엣지 장치에 배포 가능한 실시간 성능을 달성하기 위해.

제안 방법

  • 딥 러닝 네트워크가 깊이 맵이 필요 없이 단일 왼쪽 또는 오른쪽 스테레오 이미지에서 6자리 물체 자세(위치 및 자세)를 회귀한다.
  • 어텐션 메커니즘이 주목할 만한 물체 영역을 식별하여 디스파리 계산을 이들 영역으로만 제한함으로써 효율성을 향상시킨다.
  • 스테레오 그리드 어텐션 모듈이 스테레오 격자 매칭 맵을 생성하여 검출된 물체에 대해서만 디스파리 계산을 수행한다.
  • 디스파리 값은 삼각측량 원리를 이용해 깊이로 변환되어 3차원 자세 추정이 가능해진다.
  • 학습 및 평가를 위해 가상 환경에서 렌더링된 3차원 기계 부품 모델의 합성 데이터셋을 구축한다.
  • 실제 로봇 조작 장치에 전개하여 전자석 그립퍼를 사용해 혼잡한 박스에서 물체를 집는 작업을 수행한다.

실험 결과

연구 질문

  • RQ1단일 스텝 스테레오 비전 접근법이 혼잡한 박스픽킹 환경에서 정확한 6자리 물체 자세 추정을 달성할 수 있는가?
  • RQ2검출된 물체에만 집중하는 어텐션 기반 디스파리 계산이 효율성을 향상시킬 수 있는가?
  • RQ3합성 데이터가 약한 무늬를 가진 기계 부품의 실제 환경에서의 박스픽킹에 효과적으로 모델을 훈련시키는 데 기여하는가?
  • RQ4Jetson AGX Xavier와 같은 엣지 하드웨어에서 이 방법의 실시간 성능는 어떠한가?
  • RQ5다양한 질감과 형태를 가진 다양한 기계 부품에 대해 실제 환경에서의 성능는 어떠한가?

주요 결과

  • 반정밀도 모델을 사용하여 Jetson AGX Xavier에서 1024×1024 픽셀 스테레오 이미지를 75ms 내로 처리한다.
  • 혼잡한 박스에서 검은 스틸 나사들을 집는 데 76.3%의 성공률을 기록했다.
  • 스테인리스 스틸 나사들은 64.0%의 성공률로 성공적으로 집었다.
  • DC 모터 케이스 부품은 50.5%, 로터 코어는 89.1%, 커뮤투터 캡은 64.2%의 성공률로 집는 데 성공했다.
  • 합성 데이터의 사용으로 약한 무늬를 가진 기계 부품에 대해 실제 환경 배포에 효과적으로 훈련할 수 있었다.
  • 어텐션 기반 디스파리 계산은 전체 이미지의 디스파리 추정을 방지함으로써 처리 부담을 크게 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.