Skip to main content
QUICK REVIEW

[논문 리뷰] MoreFusion: Multi-object Reasoning for 6D Pose Estimation from Volumetric Fusion

Kentaro Wada, Edgar Sucar|arXiv (Cornell University)|2020. 04. 09.
Robotics and Sensor-Based Localization참고 문헌 30인용 수 12
한 줄 요약

MoreFusion는 RGB-D 데이터로부터의 체적 융합을 사용하여 다중 객체의 6자리 자세 추정을 실시간으로 수행하는 시스템을 제안한다. 이는 비상호 간섭 제약 조건을 미분 가능한 충돌 체크를 통해 동시에 최적화함으로써 객체 자세를 공동으로 최적화한다. 주변 점유 격자와 CAD 모델 피팅을 통합함으로써 YCB-Video 및 혼잡한 YCB-Video에서 최신 기술 수준의 정확도를 달성하며, 혼잡한 환경에서의 견고한 로봇 조작을 가능하게 한다.

ABSTRACT

Robots and other smart devices need efficient object-based scene representations from their on-board vision systems to reason about contact, physics and occlusion. Recognized precise object models will play an important role alongside non-parametric reconstructions of unrecognized structures. We present a system which can estimate the accurate poses of multiple known objects in contact and occlusion from real-time, embodied multi-view vision. Our approach makes 3D object pose proposals from single RGB-D views, accumulates pose estimates and non-parametric occupancy information from multiple views as the camera moves, and performs joint optimization to estimate consistent, non-intersecting poses for multiple objects in contact. We verify the accuracy and robustness of our approach experimentally on 2 object datasets: YCB-Video, and our own challenging Cluttered YCB-Video. We demonstrate a real-time robotics application where a robot arm precisely and orderly disassembles complicated piles of objects, using only on-board RGB-D vision.

연구 동기 및 목표

  • 실내에서 상호 오염, 접촉하는 구성으로 알려진 다수의 객체에 대해 차량 내 RGB-D 센서를 사용하여 정확하고 실시간으로 6자리 자세 추정을 가능하게 하기.
  • 학습된 체적 점유 맵를 통한 공간 인식을 활용하여 객체 간 상호 오염과 접촉 문제를 해결하기.
  • 충돌 제약 조건을 사용하여 다중 객체 자세를 공동 최적화함으로써 단일 객체 기반의 깊이 기반 방법을 초월한 자세 정확도 향상하기.
  • 지속적인 3차원 장면 표현과 CAD 모델 정렬을 통합하여 견고한 점진적 장면 재구성과 로봇 계획 가능하게 하기.
  • 차량 내 시각 기반으로 단지 실시간으로 작동하는 로봇 시스템을 통해 혼잡한 물체 무더미의 지능적인 분해를 수행할 수 있도록 하기.

제안 방법

  • 시스템은 2D 인스턴스 세그멘테이션 마스크와 RGB-D 데이터를 융합하여 자유, 점유, 알 수 없는 공간을 나타내는 32×32×32 박자화된 체적 점유 격자를 생성한다.
  • 3D-CNN 기반 자세 예측 네트워크는 대상 객체의 RGB-D 캡처와 주변 점유 격자를 사용하여 초기 6자리 자세 가설을 생성한다.
  • 반복적 충돌 체크(ICC)는 박자화된 공간에서의 교차를 방지하기 위해 허용 가능한 충돌 제약 조건을 적용함으로써 다중 객체 자세를 동시에 최적화한다.
  • 자세 정밀화는 ICC와 ICP를 조합하여 충돌 해결 이후 표면 수준의 정렬을 향상시킨다.
  • 신뢰할 수 있는 정렬이 이루어지고 교차가 없을 경우, 시스템은 체적 객체 표현을 고해상도 CAD 모델로 점진적으로 교체한다.
  • 전체 파이프라인은 엔드 투 엔드로 미분 가능하며 실시간으로 작동하여 점진적 장면 재구성과 로봇 작업 실행을 가능하게 한다.

실험 결과

연구 질문

  • RQ1오직 RGB-D 입력만을 사용하여 상호 오염 및 접촉이 발생하는 장면에서 다중 객체 6자리 자세 추정을 어떻게 향상시킬 수 있는가?
  • RQ2체적 점유를 통한 주변 공간 인식을 통합할 경우, 단일 객체 방법 대비 자세 예측 정확도가 얼마나 향상되는가?
  • RQ3미분 가능한 충돌 체크를 통해 다중 객체 자세를 공동 최적화하여 교차를 해결하고 일관성을 향상시킬 수 있는가?
  • RQ4CAD 모델 피팅 통합이 혼잡한 환경에서 자세 정확도와 장면 표현을 어떻게 향상시키는가?
  • RQ5체적 융합 기반의 실시간 점진적 시스템이 혼잡한 물체 무더미의 분해와 같은 복잡한 로봇 조작 작업을 수행할 수 있는가?

주요 결과

  • MoreFusion는 혼잡한 YCB-Video 데이터셋에서 83.4%의 ADD(-S)와 92.3%의 ADD-S를 달성하여 DenseFusion*보다 각각 1.7%와 0.6% 높은 성능을 보였다.
  • 주변 점유 정보를 포함함으로써 성능 향상이 이루어졌으며, 점유 정보가 없는 MoreFusion(-occ)조차도 3D-CNN 아키텍처 덕분에 DenseFusion*를 초월했다.
  • ICC와 ICP 정밀화의 조합이 가장 우수한 결과를 내었으며, 특히 시야가 낮은 경우(예: <40%)에서 ICC는 ICP만으로는 해결할 수 없는 충돌을 해결했다.
  • 시야 제한 구간(시야 < 0.3)에서 MoreFusion는 63.5%의 ADD(-S)와 85.1%의 ADD-S를 기록하여 DenseFusion*(59.7%와 83.8%)를 초월했다.
  • 시스템은 혼잡한 환경에서 실시간으로 피킹 및 놓기 작업을 수행할 수 있으며, 장애물이 되는 물체를 제거하고 대상 물체를 차량 내 RGB-D 시각 기반으로 정확히 놓는 데 성공했다.
  • 전체 시스템 시연를 통해 정확한 CAD 정렬을 통한 점진적 장면 재구성 가능성을 입증하였으며, 이웃한 물체의 공간 제약 조건을 활용하여 오염된 물체의 자세를 추론할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.