Skip to main content
QUICK REVIEW

[논문 리뷰] Probabilistic 3D Multilabel Real-time Mapping for Multi-object Manipulation

Kentaro Wada, Kei Okada|arXiv (Cornell University)|2020. 01. 16.
Robotics and Sensor-Based Localization참고 문헌 21인용 수 7
한 줄 요약

이 논문은 다중 시야 RGB-D 데이터로부터 조밀한 다중 객체 3D 분할을 가능하게 하기 위해 오кт오그램을 확장하여 각 복셀에 다중 객체 레이블과 충돌 점유 정보를 동시에 표현하는 실시간 확률적 3D 다중라벨 매핑 방법을 제안한다. 이 방법은 무거운 음영 조건에서도 다중 객체 작업에서 86.9%의 인식률과 60.7%의 성공적인 조작률을 달성하며, 평균 $IU_{3d}$ 기준으로 투영 기반 방법보다 40–96% 향상된다.

ABSTRACT

Probabilistic 3D map has been applied to object segmentation with multiple camera viewpoints, however, conventional methods lack of real-time efficiency and functionality of multilabel object mapping. In this paper, we propose a method to generate three-dimensional map with multilabel occupancy in real-time. Extending our previous work in which only target label occupancy is mapped, we achieve multilabel object segmentation in a single looking around action. We evaluate our method by testing segmentation accuracy with 39 different objects, and applying it to a manipulation task of multiple objects in the experiments. Our mapping-based method outperforms the conventional projection-based method by 40 - 96\% relative (12.6 mean $IU_{3d}$), and robot successfully recognizes (86.9\%) and manipulates multiple objects (60.7\%) in an environment with heavy occlusions.

연구 동기 및 목표

  • 혼잡하고 음영이 많은 환경에서 실시간 다중라벨 3D 객체 분할의 부족을 해결하기 위해.
  • 단일 레이블 확률적 매핑을 다중 객체 레이블을 동시에 지원하는 단일 복셀 격자로 확장하기 위해.
  • 무거운 음영 조건 하에서도 실시간 조밀한 3D 분할 및 다중 객체 조작을 가능하게 하기 위해.
  • 이 방법의 성능을 분할 정확도 및 실제 조작 작업 모두에서 평가하기 위해.

제안 방법

  • 오кт오그램을 확장하여 각 복셀에 다중라벨 점유 확률을 저장함으로써, 다중 객체 레이블과 충돌 정보를 동시에 표현할 수 있도록 한다.
  • 이중 단계 시스템을 사용: 딥러닝을 통한 2D 인스턴스 분할로 각 클래스의 확률 지ap을 생성한 후, 복셀 단위의 레이블 확률 업데이트를 통한 3D 매핑.
  • RGB-D 카메라 캘리브레이션을 사용해 2D 확률 지도를 3D 점으로 투영하고, 단일 오кт리 구조 내에서 다수의 시야에서의 확률을 누적한다.
  • 베이지안 업데이트를 적용하여 시간에 따라 각 복셀의 다중라벨 점유 확률을 유지하고 정밀하게 개선한다.
  • 각 복셀의 최대 레이블 확률을 사용해 최종 객체 레이블 할당을 결정하며, 점유 여부는 임계값을 기준으로 한다.
  • 로봇 조작 파이프라인에 매핑을 통합하여 순차적인 객체 인식, 가림 물체 제거, 목표물 집기 작업을 수행한다.

실험 결과

연구 질문

  • RQ1다중 시야 RGB-D 데이터로부터 실시간 3D 다중라벨 점유 매핑를 구성할 수 있는가? 이는 조밀한 다중 객체 분할을 지원하기 위해 필수적이다.
  • RQ2음영 환경에서 다중라벨 3D 매핑은 2.5D 투영 기반 방법에 비해 분할 정확도를 얼마나 향상시키는가?
  • RQ3제안된 방법이 얼마나 높은 음영 조건 하에서도 성공적인 다중 객체 조작을 가능하게 하는가?
  • RQ4실제 조작 작업에서 인식, 장애물 제거, 목표물 집기 과정에서의 시스템 성능은 어떠한가?

주요 결과

  • 제안된 방법은 평균 $IU_{3d}$가 12.6을 기록하여, 투영 기반 방법보다 상대적으로 40–96% 향상되었다.
  • 다중 객체 조작 작업에서 로봇은 시험의 86.9%에서 목표물과 비목표물을 올바르게 인식했다.
  • 장애물 제거 및 목표물 집기 과정을 포함한 전체 작업의 성공률은 60.7%를 기록했다.
  • 자기 음영 및 물체 간 음영 조건이 있는 환경에서도 강건성을 입증하였으며, 단일 시야 투영 방법보다 뛰어난 성능을 보였다.
  • 실패 사례의 주요 원인은 그립퍼의 공기 누설( grasping 실패 ) 또는 인식 과정에서 비목표 물체의 잘못된 분류였다.
  • 실시간 성능를 달성하여 단일 다중 시야 관측 주기 내에서 전체 3D 분할 및 조작이 가능했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.