Skip to main content
QUICK REVIEW

[논문 리뷰] Segmenting Unknown 3D Objects from Real Depth Images using Mask R-CNN Trained on Synthetic Data

Michael Danielczuk, Matthew Matl|arXiv (Cornell University)|2018. 09. 16.
Robot Manipulation and Learning참고 문헌 51인용 수 7
한 줄 요약

이 논문은 도메인 랜덤라이제이션을 사용하여 유일하게 합성된 깊이 이미지로 훈련된 카테고리 무관 인스턴스 세그멘테이션 모델인 Synthetic Depth Mask R-CNN(SD Mask R-CNN)을 제안한다. 이 모델은 실제 깊이 이미지에서 최신 기술 성능을 달성하며, 포인트 클러스터링 기반 모델보다 평균 정밀도(Average Precision)에서 15% 향상되고 평균 재현도(Average Recall)에서 20% 향상되며, 실제 데이터로 미세조정된 모델과 동등한 성능을 보이며, 인간 레이블이 없는 실제 데이터를 사용하지 않고도 견고한 로봇 그립핑을 가능하게 한다.

ABSTRACT

The ability to segment unknown objects in depth images has potential to enhance robot skills in grasping and object tracking. Recent computer vision research has demonstrated that Mask R-CNN can be trained to segment specific categories of objects in RGB images when massive hand-labeled datasets are available. As generating these datasets is time consuming, we instead train with synthetic depth images. Many robots now use depth sensors, and recent results suggest training on synthetic depth data can transfer successfully to the real world. We present a method for automated dataset generation and rapidly generate a synthetic training dataset of 50,000 depth images and 320,000 object masks using simulated heaps of 3D CAD models. We train a variant of Mask R-CNN with domain randomization on the generated dataset to perform category-agnostic instance segmentation without any hand-labeled data and we evaluate the trained network, which we refer to as Synthetic Depth (SD) Mask R-CNN, on a set of real, high-resolution depth images of challenging, densely-cluttered bins containing objects with highly-varied geometry. SD Mask R-CNN outperforms point cloud clustering baselines by an absolute 15% in Average Precision and 20% in Average Recall on COCO benchmarks, and achieves performance levels similar to a Mask R-CNN trained on a massive, hand-labeled RGB dataset and fine-tuned on real images from the experimental setup. We deploy the model in an instance-specific grasping pipeline to demonstrate its usefulness in a robotics application. Code, the synthetic training dataset, and supplementary material are available at https://bit.ly/2letCuE.

연구 동기 및 목표

  • 인간 레이블이 없는 실제 훈련 데이터가 필요 없이 실제 깊이 이미지에서 카테고리 무관 인스턴스 세그멘테이션을 가능하게 하기 위해.
  • 로봇 인식을 위한 수동 레이블링 데이터셋의 높은 레이블링 비용과 제한된 확장성 문제를 해결하기 위해.
  • 복잡한 기하학적 구조와 가림을 포함한 실제의 혼잡한 환경으로의 시뮬레이션에서의 일반화 성능을 높이기 위해.
  • 실제 로봇 응용 분야(예: 인스턴스 특정 그립핑)에 적합한 합성 데이터와 도메인 랜덤라이제이션의 효과를 입증하기 위해.

제안 방법

  • 저자들은 3D CAD 모델의 시뮬레이션 힙을 사용하여 50,000장의 깊이 이미지와 320,000개의 객체 마스크로 구성된 합성 데이터셋을 생성한다.
  • 훈련 중 도메인 랜덤라이제이션을 적용하여 카메라 자세, 내부 파라미터, 객체 위치를 다양화함으로써 시뮬레이션에서 실제 환경으로의 일반화 성능을 향상시킨다.
  • 실제 데이터나 카테고리별 지도 학습 없이도 인스턴스 세그멘테이션을 수행할 수 있도록 합성 데이터셋(WISDOM-Sim)에서 마스크 R-CNN의 변종을 훈련시킨다.
  • 다양한 물체 기하학적 구조를 가진 고해상도 실제 데이터셋(WISDOM-Real)에서 성능을 평가한다.
  • 사전 훈련된 VGG-16 분류기를 사용하여 분할 마스크에서 대상 물체를 선택하는 인스턴스 특정 그립핑 파이프라인에 방법을 통합한다.
  • COCO 지표와 로봇 그립핑 성공률을 사용하여 포인트 클러스터링 및 실제 데이터로 미세조정된 마스크 R-CNN와의 성능을 비교 평가한다.

실험 결과

연구 질문

  • RQ1유일하게 합성 깊이 이미지로 훈련된 마스크 R-CNN 모델이 실제 깊이 이미지에서 높은 성능의 인스턴스 세그멘테이션을 달성할 수 있는가?
  • RQ2도메인 랜덤라이제이션이 깊이 기반 인스턴스 세그멘테이션에서 시뮬레이션에서 실제 환경으로의 일반화에 어떻게 기여하는가?
  • RQ3합성 데이터 훈련이 분할 정확도와 로봇 작업 성공률 측면에서 실제 데이터로의 미세조정보다 우수한가?
  • RQ4모델이 저해상도 센서와 극도로 가려진 환경으로의 일반화 성능는 어느 정도인가?
  • RQ5인간 레이블이 없는 실제 데이터 없이도 효과적인 인스턴스 특정 그립핑을 가능하게 할 수 있는가?

주요 결과

  • SD Mask R-CNN는 WISDOM-Sim 테스트 세트에서 평균 정밀도 66.4%와 평균 재현도 74.8%를 달성하여, 유럽 클러스터링(16.1% AP)과 리전 그로잉(17.2% AP)보다 유의미하게 뛰어나다.
  • 실제 환경 WISDOM-Real 데이터셋에서, SD Mask R-CNN는 포인트 클러스터링 기반 모델 대비 평균 정밀도 15% 포인트 향상되고 평균 재현도 20% 포인트 향상되었다.
  • 저해상도 깊이 센서로의 일반화 성능도 유지되며, 해상도 저하에도 불구하고 뛰어난 성능을 보였다.
  • 인스턴스 특정 그립핑 실험에서, SD Mask R-CNN는 74%의 성공률을 기록하여 유럽 클러스터링(56%)을 능가했으며, 실제 데이터로 미세조정된 마스크 R-CNN(78%)와 동등한 성능를 보였다.
  • 100개의 초기 캡처에서 유도된 1,000장의 증강 이미지로 훈련된 분류기는 2분 이내에 미세조정되었으며, 낮은 데이터 및 훈련 오버헤드를 입증하였다.
  • 비용이 많이 드는 인간 레이블링 의존도를 줄이고, 새로운 로봇 작업에 대해 세그멘테이션 기능의 빠른 구현을 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.