Skip to main content
QUICK REVIEW

[논문 리뷰] DualPoseNet: Category-level 6D Object Pose and Size Estimation Using Dual Pose Network with Refined Learning of Pose Consistency

Jiehong Lin, Zewei Wei|arXiv (Cornell University)|2021. 03. 11.
Robot Manipulation and Learning참고 문헌 31인용 수 6
한 줄 요약

DualPoseNet는 단일 RGB-D 이미지에서 카테고리 수준의 6자유도 물체 자세 및 크기 추정을 위한 이중 분지 자세 네트워크를 제안하며, 개선된 자세 일致성 학습을 통해 성능을 향상시킵니다. 공유된 구형 컬러블 기반 인코더와 두 개의 병렬 디코더(일반형 및 은닉형)를 사용하며, 은닉형 디코더가 추론 중에 자기지도 학습을 통해 정밀도를 향상시켜 최신 기술 수준의 성능을 달성합니다. 특히 고정밀도 지표에서 뛰어난 성능을 보입니다.

ABSTRACT

Category-level 6D object pose and size estimation is to predict full pose configurations of rotation, translation, and size for object instances observed in single, arbitrary views of cluttered scenes. In this paper, we propose a new method of Dual Pose Network with refined learning of pose consistency for this task, shortened as DualPoseNet. DualPoseNet stacks two parallel pose decoders on top of a shared pose encoder, where the implicit decoder predicts object poses with a working mechanism different from that of the explicit one; they thus impose complementary supervision on the training of pose encoder. We construct the encoder based on spherical convolutions, and design a module of Spherical Fusion wherein for a better embedding of pose-sensitive features from the appearance and shape observations. Given no testing CAD models, it is the novel introduction of the implicit decoder that enables the refined pose prediction during testing, by enforcing the predicted pose consistency between the two decoders using a self-adaptive loss term. Thorough experiments on benchmarks of both category- and instance-level object pose datasets confirm efficacy of our designs. DualPoseNet outperforms existing methods with a large margin in the regime of high precision. Our code is released publicly at https://github.com/Gorilla-Lab-SCUT/DualPoseNet.

연구 동기 및 목표

  • 테스트용 CAD 모델에 접근할 수 없는 조건에서 카테고리 수준의 6자유도 물체 자세 및 크기 추정 문제를 해결한다.
  • SO(3)의 전체 자세 공간에서 자세 예측 정확도를 향상시키며, 특히 카테고리 내 형태 변화가 큰 물체에 대해 유의미하게 개선한다.
  • 카테고리 수준 설정에서 3차원 물체 형태에 대한 회전 등변 특징을 학습하는 데 어려움을 극복한다.
  • 실제 CAD 모델이 없는 조건에서도 추론 중에 자가 적응형 일致성 손실을 통해 자세를 정밀하게 보정할 수 있도록 한다.

제안 방법

  • RGB-D 입력에서 회전 등변 특징을 학습하기 위해 구형 컨볼루션 기반의 공유 자세 인코더를 사용한다.
  • 입력 RGB-D 영역의 외관 및 형태 특징을 통합하여 임베딩하는 Spherical Fusion 모듈을 설계한다.
  • 두 개의 병렬 디코더를 구현: 직접 자세 예측을 위한 일반형 디코더와 입력 포인트 클러스터를 기준 자세에서 재구성하는 은닉형 디코더.
  • 추론 중에 두 디코더 간의 일致성을 강제로 유지하기 위해 자가 적응형 일치 손실을 도입한다.
  • CAD 모델이 필요 없이도 일치 손실을 활용해 인코더를 반복적으로 미세조정하여 정밀도를 향상시킨다.
  • DualPoseNet 파이프라인에 입력하기 전에 객체 영역을 분리하기 위해 표준 인스턴스 세그멘테이션(예: Mask R-CNN)을 활용한다.

실험 결과

연구 질문

  • RQ1서로 다른 감독 신호를 가진 이중 디코더 아키텍처가 카테고리 수준 설정에서 6자유도 자세 및 크기 추정 성능을 향상시킬 수 있는가?
  • RQ2CAD 모델이 없이도 포인트 클러스터 재구성 방식을 통한 은닉형 자세 예측이 일반화 성능 향상과 정밀도 보정에 얼마나 효과적인가?
  • RQ3개선된 자세 일치 학습이 특히 고정밀도 지표에서 예측 정확도를 얼마나 향상시키는가?
  • RQ4제안된 방법이 최소한의 적응만으로 인스턴스 수준의 6자유도 자세 추정 작업에 일반화 가능한가?

주요 결과

  • DualPoseNet는 CAMERA25 및 REAL275 벤치마크에서 기존 방법(예: NOCS, SPD, CASS)을 능가하는 최신 기술 수준의 성능을 달성하며, 특히 고정밀도 지표에서 뛰어난 성능을 보입니다.
  • 반복 정밀 조정을 사용할 경우 YCB-Video에서 평균 ADD(S) AUC 지표로 mAP 96.5%를, LineMOD에서 98.2%를 기록합니다.
  • 정밀 학습 과정은 최적화가 더 정밀한 해의 영역으로 수렴하도록 유도함으로써, 더 엄격한 IoU 및 각도 임계값에서 성능 향상을 입증합니다.
  • 추론 시 정밀 조정은 표준 서버에서 인스턴스당 약 0.2초만 추가로 소요되어 반복 최적화에도 불구하고 효율적입니다.
  • 제거 실험 결과, 은닉형 디코더와 개선된 일치 학습 모두 성능 향상에 기여하는 것으로 확인되었습니다.
  • 정성적 결과에서는 특히 형태가 복잡한 물체(예: 노트북)에 대해 기존 방법 대비 더 컴act하고 정확한 경계 상자 예측 결과를 도출합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.