Skip to main content
QUICK REVIEW

[논문 리뷰] LabelFusion: A Pipeline for Generating Ground Truth Labels for Real RGBD Data of Cluttered Scenes

Pat Marion, Pete Florence|arXiv (Cornell University)|2017. 07. 15.
Advanced Neural Network Applications참고 문헌 18인용 수 8
한 줄 요약

LabelFusion는 3D 재구성과 ICP 보조 메쉬 피팅을 활용하여 혼잡한 환경의 실세계 RGBD 데이터에 대해 빠르고 고품질의 레이블링을 가능하게 하는 오픈소스 파이프라인입니다. 이는 인간의 레이블링 시간을 장당 수 시간에서 수 분으로 줄이며, 며칠 내로 100만 개 이상의 레이블링된 객체 인스턴스를 생성했습니다. 실험 결과에 따르면 다중 객체, 다중 환경 훈련 데이터는 로봇 조작을 위한 딥러닝 기반 분할 모델의 일반화 능력을 크게 향상시킵니다.

ABSTRACT

Deep neural network (DNN) architectures have been shown to outperform traditional pipelines for object segmentation and pose estimation using RGBD data, but the performance of these DNN pipelines is directly tied to how representative the training data is of the true data. Hence a key requirement for employing these methods in practice is to have a large set of labeled data for your specific robotic manipulation task, a requirement that is not generally satisfied by existing datasets. In this paper we develop a pipeline to rapidly generate high quality RGBD data with pixelwise labels and object poses. We use an RGBD camera to collect video of a scene from multiple viewpoints and leverage existing reconstruction techniques to produce a 3D dense reconstruction. We label the 3D reconstruction using a human assisted ICP-fitting of object meshes. By reprojecting the results of labeling the 3D scene we can produce labels for each RGBD image of the scene. This pipeline enabled us to collect over 1,000,000 labeled object instances in just a few days. We use this dataset to answer questions related to how much training data is required, and of what quality the data must be, to achieve high performance from a DNN architecture.

연구 동기 및 목표

  • 로봇 조작을 위한 6DOF 객체 자세를 포함한 대규모 실세계, 픽셀 단위 레이블링된 RGBD 데이터셋의 부족을 해결하기 위해.
  • 재사용 가능한 시나리오 수준의 레이블링 파이프라인을 통해 RGBD 데이터 레이블링에 대한 인간의 작업 시간을 수십 배에서 수백 배 이상 감소시키기 위해.
  • 데이터 양, 시나리오의 복잡성, 환경의 다양성이 딥러닝 기반 로봇 인식의 일반화에 미치는 영향을 실증적으로 조사하기 위해.
  • 연구자들이 자신의 특정 로봇 작업에 맞는 맞춤형 고품질 훈련 데이터셋을 생성할 수 있도록 확장 가능한 오픈소스 솔루션을 제공하기 위해.

제안 방법

  • RGBD 센서를 사용하여 다양한 시점에서 시나리오의 다중 시점 RGBD 영상 촬영.
  • 기존의 다중 시점 스테레오 및 ICP 기반 융합 기법을 사용하여 시나리오의 고밀도 3D 재구성 생성.
  • 정확한 자세 추정을 위해 인간의 보조를 받는 ICP를 사용하여 사전 존재하는 3D 객체 메쉬를 3D 재구성에 수동으로 피팅.
  • 레이블링된 3D 메쉬를 각 개별 RGBD 이미지로 재투영하여 픽셀 단위의 세분화 및 6DOF 객체 자세 레이블 생성.
  • 네트워크의 일반화 능력을 향상시키기 위해 높은 시점 다양성과 시나리오 변동성을 확보하기 위해 데이터 수집 최적화.
  • 수집된 데이터를 사용하여 제어된 데이터 변동 조건 하에서 최신 세분화 네트워크의 훈련 및 평가 수행.

실험 결과

연구 질문

  • RQ1다중 객체 시나리오와 음영이 있는 환경이 딥러닝 기반 세분화 네트워크의 일반화 성능에 어떤 영향을 미치는가?
  • RQ2배경 환경의 다양성이 새로운, 볼 수 없는 시나리오로의 일반화에 어떤 영향을 미치는가?
  • RQ3최적의 세분화 성능를 달성하기 위해 시나리오당 몇 개의 시점이 필요한가? 고프레임레이트(30 Hz) 데이터는 성능 향상에 한계를 보이는가?
  • RQ4새로운, 볼 수 없는 환경에서 테스트했을 때, 단일 객체 vs. 다중 객체 시나리오에서 훈련된 네트워크의 성능는 어떻게 비교되는가?

주요 결과

  • 음영이 있는 다중 객체 시나리오에서 훈련된 네트워크는 단일 객체 시나리오에서 훈련된 네트워크보다 새로운 시나리오로의 일반화 능력이 뚜렷이 향상되었으며, 이는 단일 객체 설정에서 테스트한 경우에도 마찬가지였다.
  • 새로운 배경 환경에서의 성능는 훈련 배경의 수에 따라 로그 스케일로 향상되었으며, 약 50개의 배경을 훈련 데이터로 사용할 경우, 새로운 시나리오에서 IoU가 50% 이상 달성되었다.
  • 효과적인 센서 샘플링 레이트가 높아질수록 세분화 성능가 지속적으로 향상되었지만, 느린 움직임을 보이는 로봇 암에 장착된 데이터의 경우 0.3 Hz를 초과하면 성능 향상의 효과가 감소함을 보여, 대부분의 응용 분야에 3 Hz가 충분함을 시사했다.
  • 더 높은 카메라 운동 속도(~0.05–0.17 m/s)를 가진 수동 운반 데이터 수집 설정은 느린 로봇 장착 데이터에 비해 높은 프레임 레이트에서 더 큰 성능 향상을 보였다.
  • 이 파이프라인은 이미지당 수 시간의 인간 레이블링 시간을 전체 시나리오당 수 분으로 줄였으며, 이로 인해 며칠 내로 100만 개 이상의 레이블링된 객체 인스턴스를 수집할 수 있었다.
  • 352,000장의 레이블링된 이미지와 1,000,000개 이상의 객체 인스턴스를 포함한 이 데이터셋은 픽셀 단위의 레이블과 6DOF 객체 자세 레이블을 모두 갖춘 가장 큰 공개 RGBD 데이터셋이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.