Skip to main content
QUICK REVIEW

[논문 리뷰] Single-Stage 6D Object Pose Estimation

Yinlin Hu, Pascal Fua|arXiv (Cornell University)|2019. 11. 19.
Robot Manipulation and Learning참고 문헌 56인용 수 4
한 줄 요약

이 논문은 3D-2D 관점 대응 관계에서 직접 6D 자세를 회귀하는 단일 단계 6D 객체 자세 추정 프레임워크를 제안한다. 이는 대응 그룹 내의 순열 불변성을 다루기 위해 설계된 딥 네트워크를 사용하며, 동시에 관점 순서를 유지한다. 기존의 RANSAC 기반 PnP 단계를 엔드 투 엔드 미분 가능한 네트워크로 대체함으로써, 두 단계 기반 기준보다 더 높은 정확도와 속도를 달성하며, LINEMOD 및 YCB-Video 벤치마크에서 PoseCNN, SegDriven, PVNet과 같은 최신 기술을 초월한다.

ABSTRACT

Most recent 6D pose estimation frameworks first rely on a deep network to establish correspondences between 3D object keypoints and 2D image locations and then use a variant of a RANSAC-based Perspective-n-Point (PnP) algorithm. This two-stage process, however, is suboptimal: First, it is not end-to-end trainable. Second, training the deep network relies on a surrogate loss that does not directly reflect the final 6D pose estimation task. In this work, we introduce a deep architecture that directly regresses 6D poses from correspondences. It takes as input a group of candidate correspondences for each 3D keypoint and accounts for the fact that the order of the correspondences within each group is irrelevant, while the order of the groups, that is, of the 3D keypoints, is fixed. Our architecture is generic and can thus be exploited in conjunction with existing correspondence-extraction networks so as to yield single-stage 6D pose estimation frameworks. Our experiments demonstrate that these single-stage frameworks consistently outperform their two-stage counterparts in terms of both accuracy and speed.

연구 동기 및 목표

  • RANSAC 기반 PnP 단계를 사용하는 두 단계 기반 6D 자세 추정 파이프라인의 최적화되지 않은 학습 및 엔드 투 엔드가 아닌 성격을 해결하기 위해.
  • 최종 자세 정확도를 직접 최적화하지 않는 보조 손실(예: 2D 재투영 오차)에 의존하는 것을 제거하기 위해.
  • 3D-2D 대응 관계에서 직접 6D 자세로 매핑하는, 미분 가능하고 엔드 투 엔드로 학습 가능한 아키텍처를 개발하여 정확도와 추론 속도를 향상시키기 위해.
  • 기존의 대응 추출 네트워크와 결합했을 때 제안된 자세 회귀 네트워크의 일반성과 효능을 입증하기 위해.

제안 방법

  • 이 방법은 후보 3D-2D 대응 그룹을 입력으로 받는 딥 신경망을 도입하며, 각 그룹은 3D 관점에 대응한다.
  • 네트워크는 각 대응 그룹 내의 순열 불변성을 명시적으로 모델링한다(즉, 3D 관점에 대응하는 대응의 순서는 출력에 영향을 주지 않음), 동시에 3D 관점 순서에 대응하는 그룹의 고정된 순서를 유지한다.
  • 기존의 RANSAC 기반 PnP 알고리즘을 대체하여, 대응에서 직접 6D 자세를 회귀하는 학습 가능한, 미분 가능한 모듈을 도입한다.
  • 이 아키텍처는 일반적이며, 최신 기술의 대응 추출 네트워크와 원활하게 통합되어 엔드 투 엔드 학습이 가능하다.
  • 표준 최적화 기법(Adam), 데이터 증강, 그리고 합성 및 실재 데이터에서 3D 및 2D 자세 오차(ADD 및 REP)를 최소화하는 손실 함수를 사용하여 네트워크를 학습한다.
  • 표준 평가 지표를 사용하여 LINEMOD 및 YCB-Video 데이터셋에서 평가한다: ADD-0.1d 및 REP-5px.

실험 결과

연구 질문

  • RQ1엔드 투 엔드로 학습 가능한 방식으로, RANSAC 기반 PnP 단계를 생략하고 3D-2D 대응에서 직접 6D 자세를 회귀할 수 있는 딥 네트워크를 설계할 수 있는가?
  • RQ2RANSAC 단계를 학습 가능한, 미분 가능한 모듈로 대체함으로써, 두 단계 기반 기준에 비해 자세 추정 정확도와 추론 속도가 향상되는가?
  • RQ3제안된 자세 회귀 네트워크는 SegDriven 및 PVNet과 같은 다양한 대응 추출 네트워크에 일반화되어 작동하는가?
  • RQ4오염 및 혼잡 조건 하에서 단일 단계 프레임워크의 성능은 최신 기술의 두 단계 기반 방법과 정확도 및 런타임 측면에서 어떻게 비교되는가?

주요 결과

  • SegDriven 또는 PVNet을 사용하여 대응 예측을 수행할 경우, LINEMOD 데이터셋에서 원래의 두 단계 기반 버전보다 일관되게 정확도 향상을 달성한다.
  • LINEMOD에서 PVNet과 조합했을 경우, ADD-0.1d는 95.3%이며, REP-5px는 98.7%를 기록하여 두 단계 기반 PVNet 기준을 초월한다.
  • YCB-Video에서, ADD-0.1d는 89.2%이며, REP-5px는 94.1%를 기록하여 정확도와 속도 면에서 PoseCNN, SegDriven, PVNet을 모두 뛰어넘는다.
  • 반복적인 RANSAC 단계를 제거함으로써, PoseCNN보다 거의 10배 빠르고, SegDriven 및 PVNet보다 거의 2배 빠르게 실행된다.
  • 제안된 네트워크는 RANSAC보다 더 높은 반복성(재현성)을 보이며, 입력 대응의 순서에 민감하지 않아 기존 PnP 단계와는 달리 순서에 영향을 받지 않는다.
  • 개선된 성능에도 불구하고, 매우 정밀한 대응을 제공받을 경우 기존 기하 기반 PnP보다 학습된 자세 네트워크의 정확도가 떨어지며, 이상적인 조건 하에서도 성능 격차가 존재함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.