Skip to main content
QUICK REVIEW

[논문 리뷰] Unseen Object Instance Segmentation for Robotic Environments

Christopher Xie, Xiang Yu|arXiv (Cornell University)|2020. 07. 16.
Robot Manipulation and Learning참고 문헌 85인용 수 10
한 줄 요약

이 논문은 합성 RGB-D 데이터를 사용하여 로봇 테이블탑 환경에서의 미리 보지 않은 물체 인스턴스 세분화를 위한 두 단계의 딥러닝 프레임워크인 UOIS-Net을 제안한다. 먼저 깊이만을 사용하여 중심 투표 회귀를 통해 원초기 마스크를 생성하고, 이후 RGB를 사용하여 이를 정밀하게 다듬는 방식으로, 비사진적 합성 RGB로 훈련함에도 불구하고 실제 세계의 새로운 물체에 대해 최신 기술 수준의 일반화 성능을 달성한다.

ABSTRACT

In order to function in unstructured environments, robots need the ability to recognize unseen objects. We take a step in this direction by tackling the problem of segmenting unseen object instances in tabletop environments. However, the type of large-scale real-world dataset required for this task typically does not exist for most robotic settings, which motivates the use of synthetic data. Our proposed method, UOIS-Net, separately leverages synthetic RGB and synthetic depth for unseen object instance segmentation. UOIS-Net is comprised of two stages: first, it operates only on depth to produce object instance center votes in 2D or 3D and assembles them into rough initial masks. Secondly, these initial masks are refined using RGB. Surprisingly, our framework is able to learn from synthetic RGB-D data where the RGB is non-photorealistic. To train our method, we introduce a large-scale synthetic dataset of random objects on tabletops. We show that our method can produce sharp and accurate segmentation masks, outperforming state-of-the-art methods on unseen object instance segmentation. We also show that our method can segment unseen objects for robot grasping.

연구 동기 및 목표

  • 로봇이 사전 노출 없이 비구조적인 테이블탑 환경에서 새로운 물체 인스턴스를 인식하고 세분화할 수 있도록 하는 것.
  • 미리 보지 않은 물체 인스턴스 세분화를 위한 대규모 실세계 데이터셋의 부족을 해결하는 것.
  • 합성 데이터로 훈련하면서도 실제 세계 시나리오에 강력한 일반화 성능을 달성함으로써 시뮬레이션에서 실제 세계로의 도메인 갭을 메우는 것.
  • 깊이 정보를 사용해 강력한 인스턴스 위치 추정을 하고, RGB를 사용해 세밀한 경계 다듬기를 수행하는 방법을 개발함으로써, 비사진적 합성 RGB 환경에서도 효과적으로 작동하도록 하는 것.

제안 방법

  • UOIS-Net은 두 단계 아키텍처를 사용한다: 첫 번째로, 깊이 시드 네트워크(DSN)가 합성 깊이 이미지에서 2D 또는 3D 중심 투표를 회귀하여 원초기 마스크를 생성한다.
  • DSN은 합성 깊이 데이터 전용으로 훈련되며, 노이즈와 도메인 이동에도 불구하고 실제 세계 깊이 센서로의 강력한 일반화 성능을 달성한다.
  • 두 번째로, 영역 다듬기 네트워크(RRN)가 원초기 마스크와 비사진적 합성 RGB 입력을 받아 물체 경계를 다듬고 정밀하고 정확한 인스턴스 마스크를 생성한다.
  • RRN은 비사진적 합성 RGB로 훈련되지만, 국소화된 마스크 조건 기반의 다듬기 작업 덕분에 실제 세계 RGB로의 일반화 성능이 효과적으로 유지된다.
  • 이 방법은 PyBullet를 사용해 테이블 위에 무작위 ShapeNet 물체를 배치하여 생성한 대규모 합성 데이터셋인 테이블탑 물체 데이터셋(TOD)을 사용한다.
  • 중심 투표에 대해 후처리 클러스터링을 적용하여 원초기 인스턴스 마스크를 생성한 후, RRN을 사용해 픽셀 수준에서 다듬는다.

실험 결과

연구 질문

  • RQ1깊이와 RGB 처리를 분리하는 두 단계 네트워크가 종단 간(end-to-end) 방법보다 실제 로봇 환경에서 새로운 물체에 대해 더 우수한 일반화 성능을 보일 수 있는가?
  • RQ2비사진적 합성 RGB로 훈련된 다듬기 네트워크가 도메인 적응 또는 도메인 랜덤라이제이션 없이 실제 세계 RGB로의 일반화 성능이 잘 되는가?
  • RQ3노이즈와 도메인 이동에 대한 강건성 측면에서, 깊이만 사용하는 중심 투표 방식이 RGB만 또는 RGB-D를 함께 사용하는 방법보다 우수한가?
  • RQ4실제 데이터 피니팅 없이도 합성 데이터로만 훈련된 모델이 실제 세계의 새로운 물체 인스턴스 세분화에서 강력한 성능을 달성할 수 있는가?
  • RQ5혼잡한 실제 테이블탑 환경에서 깊이 기반 인스턴스 세분화의 주요 실패 유형은 무엇인가?

주요 결과

  • UOIS-Net-2D와 UOIS-Net-3D는 합성 TOD 테스트 세트에서는 성능이 열등하지만, 실제 세계 테스트 데이터에서는 최신 기술 수준의 방법들인 Mask R-CNN과 PointGroup을 능가한다.
  • 실제 세계 데이터에서 UOIS-Net-2D는 오버랩 기준 F1 스코어 90.9%와 경계 기준 84.1%를 기록하여 Mask R-CNN 및 PointGroup을 초월한다.
  • 영역 다듬기 네트워크(RRN)는 실제 데이터로 훈련된 것과 거의 동일한 일반화 성능을 보이며, 마스크 다듬기 작업이 종단 간 세분화보다 RGB의 현실성에 덜 민감함을 보여준다.
  • 실제 실험에서 51개의 새로운 물체를 抓지하는 데 성공률이 80.3%를 기록했으며, 실패의 주요 원인은 주로 세분화 오류 또는 抓지 생성 정확도 부족이었다.
  • 일반적인 실패 유형은 서로 가까이 붙어 있거나 평평한 표 superfaced 물체의 과소 세분화와, 전기 드릴과 같은 비볼록 물체의 과다 세분화였다.
  • 이 프레임워크는 노이즈가 많은 깊이 센서에 대해서도 강건성을 보이며, 비사진적 합성 RGB 환경에서도 RGB를 효과적으로 활용해 경계 다듬기를 수행함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.