Skip to main content
QUICK REVIEW

[논문 리뷰] 6-DoF Grasp Planning using Fast 3D Reconstruction and Grasp Quality CNN

Yahav Avigal, Samuel Paradis|arXiv (Cornell University)|2020. 09. 18.
Robot Manipulation and Learning참고 문헌 7인용 수 7
한 줄 요약

이 논문은 여러 RGB 카메라를 통해 재학습된 학습된 스테레오 머신(Least Stereo Machine, LSM)과 새로운 다중 시야 그립 품질 컨볼루션 신경망(Multi-View Grasp-Quality CNN, MV-GQ-CNN)을 활용한 6-DoF 그립 계획 시스템을 제시한다. 다양한 시야에서의 깊이 예측을 융합함으로써 복잡한 가정용 물체에서 상단에서의 그립보다 더 견고한 그립을 달성하며, Bowls에 대해 96%의 그립 품질 점수를 기록하고, 혼잡하거나 비상단 시야 조건에서도 성능 향상을 보였다.

ABSTRACT

Recent consumer demand for home robots has accelerated performance of robotic grasping. However, a key component of the perception pipeline, the depth camera, is still expensive and inaccessible to most consumers. In addition, grasp planning has significantly improved recently, by leveraging large datasets and cloud robotics, and by limiting the state and action space to top-down grasps with 4 degrees of freedom (DoF). By leveraging multi-view geometry of the object using inexpensive equipment such as off-the-shelf RGB cameras and state-of-the-art algorithms such as Learn Stereo Machine (LSM\cite{kar2017learning}), the robot is able to generate more robust grasps from different angles with 6-DoF. In this paper, we present a modification of LSM to graspable objects, evaluate the grasps, and develop a 6-DoF grasp planner based on Grasp-Quality CNN (GQ-CNN\cite{mahler2017dex}) that exploits multiple camera views to plan a robust grasp, even in the absence of a possible top-down grasp.

연구 동기 및 목표

  • 부분적으로 가려진 물체나 최적의 방향으로 정렬되지 않은 물체가 있는 비정형이고 혼잡한 주거 환경에서 상단에서의 4-DoF 그립 계획의 한계를 해결한다.
  • 고비용 깊이 카메라에 대한 의존도를 줄이기 위해 학습된 스테레오 모델을 활용해 저비용 RGB 카메라에서 고정밀 3D 재구성을 가능하게 한다.
  • 비상단 시야에서의 다양한 카메라 시점에 걸쳐 그립 품질 예측을 일반화하는 다중 시야 그립 계획 네트워크(MV-GQ-CNN)를 개발한다.
  • LSM에서 예측한 깊이 맵이 상단 시야가 실패하는 경우에도 효과적인 6-DoF 그립 계획을 지원할 수 있음을 입증한다.

제안 방법

  • 학습된 스테레오 머신(LSM)을 기존 ShapeNet 학습 분포와 다른 가정용 물체의 합성 RGB 이미지에 대해 재학습시켰다.
  • 다양한 시야에서의 합성 RGB 및 깊이 이미지 쌍을 자동 생성하기 위해 미분 가능한 렌더링 파이프라인을 사용하여, 그립 가능한 물체 재구성을 위한 LSM 학습을 수행하였다.
  • 다양한 카메라 시점에서의 깊이 맵을 처리하고 높은 신뢰도로 6-DoF 그립 자세를 출력하는 다중 시야 GQ-CNN(MV-GQ-CNN)을 설계하였다.
  • LSM에서 예측한 깊이 맵을 GQ-CNN 프레임워크에 통합하여, 상단 시야나 고비용 깊이 센서가 필요 없이 그립 계획을 수행할 수 있도록 하였다.
  • 모든 시야에서 그립 후보를 샘플링하고 최적화하기 위해 교차 엔트로피 방법(CEM)을 사용하였으며, Q-값 예측을 통해 가장 높은 신뢰도의 그립을 선택하였다.
  • 지상 진실 깊이 맵과 LSM 예측 깊이 맵을 모두 사용하여, 다양한 물체 구조에서의 그립 품질과 견고성을 평가하였다.

실험 결과

연구 질문

  • RQ1재학습된 LSM 네트워크가 가정용 물체의 다수 RGB 이미지에서 정확한 깊이 맵을 생성할 수 있는가? 이는 후속 그립 계획에 충분한가?
  • RQ2다중 시야 GQ-CNN(MV-GQ-CNN)이 복잡한 기하학적 형태나 비이상적인 방향을 가진 물체에서 기존의 상단 시야 GQ-CNN보다 6-DoF 그립 계획에서 더 우수한 성능을 보일 수 있는가?
  • RQ3지상 진실 깊이 맵 대신 LSM 예측 깊이 맵을 사용할 경우, 그립 품질이 유지되거나 향상될 수 있는가?
  • RQ4빠른 다중 시야 재구성과 다중 시야 그립 예측의 조합이 비정형 환경에서 실시간, 저비용 로봇 그립에 가능할 수 있는가?

주요 결과

  • 재학습된 LSM은 1샷, 3샷, 9샷 입력 모두에서 일관된 재구성 오차를 보였으며, 데이터셋에서 평균 오차가 0.002896, '위쪽' 시점에서 0.003527이었으며, 입력 시야 수에 대한 강건성을 입증하였다.
  • 시험되지 않은 물체에서 재학습된 LSM은 사전 학습된 네트워크보다 우수한 성능을 보였으며, 샴푸 병이나 NutellaGo 포장지와 같은 그립 가능한 물체에서 특히 두드러졌다. 이는 학습 분포에 더 잘 맞춰졌기 때문이다.
  • MV-GQ-CNN은 다중 시야 입력을 사용하여 밥그릇에서 0.96의 그립 품질 점수를 기록했으며, 상단 시야 방법의 0.87을 초월하여 복잡한 물체에서의 그립 견고성 향상을 입증하였다.
  • 당근 모양의 물체에 대해 다중 시야 계획은 Q-값 0.96을 기록했고, 상단 시야 설정에서는 0.90이었으며, 다양한 시점에서의 더 높은 신뢰도를 보였다.
  • 장난감 의자에 대해 상단 시야 방법은 그립을 찾지 못했음(모서리 세그멘테이션 실패로 N/A), 반면 다중 시야 계획은 Q-값 0.60을 기록하여 도전적인 경우에서도 더 높은 신뢰성을 보였다.
  • LSM 예측 깊이 맵에서의 그립 품질은 지상 진실과 유사했으며, 예를 들어 왼쪽 상단 그립의 경우 지상 진실에서 Q-값 0.652, 예측 깊이에서 0.830를 기록하여 강력한 일반화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.