Skip to main content
QUICK REVIEW

[논문 리뷰] ClusterNet: 3D Instance Segmentation in RGB-D Images

Lin Shao, Ye Tian|arXiv (Cornell University)|2018. 07. 24.
Industrial Vision Systems and Defect Detection인용 수 11
한 줄 요약

ClusterNet는 객체 점유 함수의 1차 및 2차 모멘트를 회귀하여 객체 중심, 크기 및 자세를 표현함으로써 제안 없이 3D 인스턴스 세분화를 수행하는 방법을 제안한다. 시계열 구조의 딥 네트워크로 학습하고 모멘트 공간에서 클러스터링을 통해 정밀화함으로써, 합성 데이터셋에서 최신 기술을 초월하는 성능을 달성하며, 미세조정 없이도 실제 환경 데이터로의 일반화가 뛰어나다.

ABSTRACT

We propose a method for instance-level segmentation that uses RGB-D data as input and provides detailed information about the location, geometry and number of individual objects in the scene. This level of understanding is fundamental for autonomous robots. It enables safe and robust decision-making under the large uncertainty of the real-world. In our model, we propose to use the first and second order moments of the object occupancy function to represent an object instance. We train an hourglass Deep Neural Network (DNN) where each pixel in the output votes for the 3D position of the corresponding object center and for the object's size and pose. The final instance segmentation is achieved through clustering in the space of moments. The object-centric training loss is defined on the output of the clustering. Our method outperforms the state-of-the-art instance segmentation method on our synthesized dataset. We show that our method generalizes well on real-world data achieving visually better segmentation results.

연구 동기 및 목표

  • 복잡하고 교차되는 객체가 많은 장면에서 객체 수가 알려지지 않은 상태에서 3D 인스턴스 세분화 문제를 해결하기 위해.
  • 깊이 데이터와 명시적인 3D 객체 특징 표현을 활용하여 실제 로봇 인식 환경에서의 정확성과 강인성을 향상시키기 위해.
  • 과도한 교차 또는 겹치는 객체로 인해 실패하는 영역 제안 기반 기법에 대한 의존도를 제거하기 위해.
  • 미세조정 없이도 합성 데이터에서 실제 환경 데이터로의 일반화를 가능하게 하기 위해.
  • 실시간 로봇 의사결정을 위한 확장 가능한 객체 중심 프레임워크를 제공하기 위해.

제안 방법

  • 모델은 각 픽셀이 속한 객체의 1차 모멘트(객체 중심)와 2차 모멘트(크기 및 자세)를 예측하기 위해 시계열 구조의 딥 네트워크를 사용한다.
  • 예측된 모멘트로 정의된 3차원 특징 공간에서 순차적 클러스터링을 통해 객체 인스턴스를 추론한다.
  • 예측된 객체 특징, 분산, 인스턴스 유일성 위반에 대한 오차를 페널티 처리하는 객체 중심 손실 함수로 학습된다.
  • 입력 모odalities로는 RGB, 깊이, 포인트 클라우드를 포함하며, 깊이 및 포인트 클라우드 데이터를 활용하여 3D 정렬 및 세분화 성능을 향상시킨다.
  • 영역 제안 기반 기법을 회피함으로써, 각 픽셀이 경계 상자 외부의 전역 맥락에 접근할 수 있다.
  • 손실 함수는 중심점 회귀($\lambda_{p} = 100.0$), 특징 분산($\lambda_{var} = 100.0$), 인스턴스 위반($\lambda_{vio} = 100.0$)에 대한 가중 항을 포함한다.

실험 결과

연구 질문

  • RQ1제안 없이도 RGB-D 데이터를 활용해 교차되거나 혼잡한 장면에서 3D 인스턴스 세분화 성능을 초월할 수 있는 딥 러닝 프레임워크는 가능한가?
  • RQ2영역 제안 기반 기법과 비교해 명시적인 3D 객체 모멘트(중심, 크기, 자세)의 회귀 방식이 정확성과 강인성 면에서 어떻게 성능을 내는가?
  • RQ3깊이 및 포인트 클라우드 데이터를 통합함으로써 실제 환경 데이터로의 인스턴스 세분화 일반화 성능은 어느 정도 향상되는가?
  • RQ4모델은 미세조정 없이도 합성 데이터에서 실제 환경 데이터로 일반화 가능한가?
  • RQ5모멘트 공간에서의 클러스터링은 순열 불변성을 유지하면서도 효과적으로 인스턴스 식별을 복원하는가?

주요 결과

  • Our(c) 및 Our(c+cov) 모델은 합성 데이터셋에서 Mask R-CNN(C4)를 모두 초월하며, 모든 교차 수준에서 가장 높은 AP와 AR 성능을 기록했다.
  • 중요한 교차가 발생하는 객체에 대해 Our(c)는 Mask R-CNN(C4) 대비 평균 리콜이 15.6% 높아, 훨씬 더 강인한 성능을 입증했다.
  • 깊이 및 포인트 클라우드 입력을 포함한 Our(rgbxyz→c)는 RGB 전용 입력인 Our(rgb→c)에 비해 인스턴스 세분화 성능을 크게 향상시켰다.
  • Our(c)는 큰 객체에 대해 Our(rgbxyz→c)를 능가했으며, 이는 깊이 이미지가 대규모 인스턴스를 세분화하는 데 핵심적인 단서를 제공한다는 것을 시사한다.
  • 실제 환경 데이터에서 Our(c)는 높은 정확도로 다수의 객체를 성공적으로 세분화했으며, 반면 Mask R-CNN(C4)는 전체 이미지를 하나의 인스턴스로 잘못 세분화해 완전히 실패했다.
  • 모델는 미세조정 없이도 실제 환경 데이터로의 일반화가 잘 되었으며, 강력한 제로샷 전이 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.