Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Task Deep Networks for Depth-Based 6D Object Pose and Joint Registration in Crowd Scenarios

Juil Sock, Kwang In Kim|arXiv (Cornell University)|2018. 06. 11.
Mobile Crowdsensing and Crowdsourcing참고 문헌 26인용 수 21
한 줄 요약

이 논문은 붐비는 깊이 영상에서 6차원 물체 자세 추정과 동시 등록을 위한 다중 작업 딥러닝 프레임워크를 제안한다. 2D 검출, 6D 자세 회귀, 그리고 가림을 고려한 등록을 함께 훈련한다. 훈련 중에 가림 패턴을 명시적으로 모델링함으로써 기존의 후처리 ICP 정밀 조정이 필요 없이, 최신 기술 대비 15–31% 높은 평균 정밀도를 달성한다.

ABSTRACT

In bin-picking scenarios, multiple instances of an object of interest are stacked in a pile randomly, and hence, the instances are inherently subjected to the challenges: severe occlusion, clutter, and similar-looking distractors. Most existing methods are, however, for single isolated object instances, while some recent methods tackle crowd scenarios as post-refinement which accounts multiple object relations. In this paper, we address recovering 6D poses of multiple instances in bin-picking scenarios in depth modality by multi-task learning in deep neural networks. Our architecture jointly learns multiple sub-tasks: 2D detection, depth, and 3D pose estimation of individual objects; and joint registration of multiple objects. For training data generation, depth images of physically plausible object pose configurations are generated by a 3D object model in a physics simulation, which yields diverse occlusion patterns to learn. We adopt a state-of-the-art object detector, and 2D offsets are further estimated via a network to refine misaligned 2D detections. The depth and 3D pose estimator is designed to generate multiple hypotheses per detection. This allows the joint registration network to learn occlusion patterns and remove physically implausible pose hypotheses. We apply our architecture on both synthetic (our own and Sileane dataset) and real (a public Bin-Picking dataset) data, showing that it significantly outperforms state-of-the-art methods by 15-31% in average precision.

연구 동기 및 목표

  • 동일한 물체가 다수 존재하는 혼잡하고 심한 가림이 있는 박스 피킹 시나리오에서 6D 물체 자세 추정의 과제를 해결한다.
  • 격리된 인스턴스에서 훈련하고 후처리 ICP를 통해 정밀 조정에 의존하는 기존 방법의 한계를 극복한다.
  • 2D 검출, 6D 자세 추정, 동시 등록을 함께 학습하여 훈련 중 상호 가림 패턴을 모델링한다.
  • 물리 기반 3D 시뮬레이터를 사용해 다양한 물리적으로 타당한 가림 패턴을 생성하여 강건한 훈련 데이터를 확보한다.
  • 외부 정밀 조정 없이도 최신 기술 수준의 성능을 달성하며, 심한 가림과 혼잡함에 대해 강건함을 입증한다.

제안 방법

  • 공유 백본(VGG 초기화)과 세 부분 네트워크(2D 검출, 6D 자세 추정, 동시 등록)를 가진 다중 작업 딥 네트워크를 설계한다.
  • 예측 오프셋을 사용하는 두 단계 2D 검출기로 초기 바운딩 박스 예측을 정밀하게 보정하여 진짜 값과의 정렬을 향상시킨다.
  • 각 검출에 대해 다수의 자세 가설을 생성하도록 6D 자세 추정기 훈련을 수행하여 가림과 모호성에 대한 강건성을 확보한다.
  • 가림 일관성 기반으로 물리적으로 불가능한 자세 가설을 평가하고 제거하는 동시 등록 네트워크를 통합한다.
  • 물리 기반 3D 시뮬레이터를 사용해 다양한 현실적인 가림 패턴을 가진 합성 훈련 데이터를 생성한다.
  • 검출, 깊이, 3D 자세, 동시 등록 감시를 통합한 다중 작업 손실을 사용해 전체 네트워크를 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1다중 작업 딥 네트워크가 2D 검출, 6D 자세 추정, 동시 등록을 함께 학습함으로써 혼잡한 환경에서 성능 향상을 이룰 수 있는가?
  • RQ2훈련 중에 가림 패턴을 명시적으로 모델링하면 일반화 성능 향상과 후처리 ICP 의존도 감소에 기여하는가?
  • RQ3심한 가림 조건에서 최신 RGBD 및 깊이 전용 방법과 비교해 평균 정밀도 측면에서 본 논문의 방법은 어떠한가?
  • RQ4오프셋을 통한 2D 검출 정밀 조정이 후속 자세 및 등록 작업의 정확도에 얼마나 기여하는가?
  • RQ5미세 조정 없이도 모델은 새로운 혼잡한 배경과 비-박스 피킹 시나리오에 일반화 가능한가?

주요 결과

  • 제안된 방법은 합성(Siléane) 및 실제 공개된(Bin-Picking) 데이터셋 모두에서 최신 기술 대비 15–31% 높은 평균 정밀도를 달성한다.
  • ICP 후처리를 사용하지 않아도, ICP에 의존하는 방법보다 성능이 뛰어나, 엔드 투 엔드 가림 모델링의 효과를 입증한다.
  • 절단 분석 결과, 2D 검출 오프셋 헤드를 제거할 경우 성능이 크게 떨어지며, 이는 초기 정렬 정확도 향상에 있어 그 중요성을 시사한다.
  • 비-박스 피킹 데이터셋에서, 배경 클러터에 대한 일반화 능력이 뛰어나, 훈련 시 배경 제외 장면 전용으로 학습된 모델임에도 불구하고 최신 기술(Kehl 등)과 비슷한 성능을 보였다.
  • 정성적 결과에서는 경미한 가림부터 심한 가림까지의 물체 자세를 정확히 복원하는 것으로 나타났으며, 기준 방법은 다수의 가려진 인스턴스를 놓쳤다.
  • 테스트 추론 시간은 GTX 1080ti에서 1장의 깊이 영상당 204ms로 측정되어 실시간 로봇 응용에 실용적 가능성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.