Skip to main content
QUICK REVIEW

[논문 리뷰] ACR-Pose: Adversarial Canonical Representation Reconstruction Network for Category Level 6D Object Pose Estimation

Zhaoxin Fan, Zhengbo Song|arXiv (Cornell University)|2021. 11. 20.
Robot Manipulation and Learning참고 문헌 54인용 수 8
한 줄 요약

ACR-Pose는 카테고리 수준의 6자리 객체 자세 추정을 위한 적대적 캐논리컬 표현 재구성 네트워크를 제안하며, 자세에 의존하는 특징을 걸러내는 포즈 무관 모듈과 RGB, 깊이, 형태 사전 정보 간의 다중 모odal 관계를 활용하는 관계 재구성 모듈을 사용한다. 적대적 훈련을 통해 재구성된 표현의 현실성과 정확성을 향상시켜 NOCS-CAMERA 및 NOCS-REAL 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Recently, category-level 6D object pose estimation has achieved significant improvements with the development of reconstructing canonical 3D representations. However, the reconstruction quality of existing methods is still far from excellent. In this paper, we propose a novel Adversarial Canonical Representation Reconstruction Network named ACR-Pose. ACR-Pose consists of a Reconstructor and a Discriminator. The Reconstructor is primarily composed of two novel sub-modules: Pose-Irrelevant Module (PIM) and Relational Reconstruction Module (RRM). PIM tends to learn canonical-related features to make the Reconstructor insensitive to rotation and translation, while RRM explores essential relational information between different input modalities to generate high-quality features. Subsequently, a Discriminator is employed to guide the Reconstructor to generate realistic canonical representations. The Reconstructor and the Discriminator learn to optimize through adversarial training. Experimental results on the prevalent NOCS-CAMERA and NOCS-REAL datasets demonstrate that our method achieves state-of-the-art performance.

연구 동기 및 목표

  • 카테고리 수준의 6자리 객체 자세 추정을 위한 캐논리컬 3D 표현 재구성의 품질을 향상시키기 위해.
  • 기존 방법들이 자세 관련 특징을 걸러내는 데서의 한계와 다중 모달 간의 관계 정보를 忽略하는 문제를 해결하기 위해.
  • 재구성된 캐논리컬 표현의 현실성을 향상시켜 후속 자세 추정 정확도를 향상시키기 위해.
  • 6자리 자세 추정을 위한 캐논리컬 표현 학습에서 적대적 훈련의 효과성을 탐색하기 위해.

제안 방법

  • 재구성기(Reconstructor)는 자세에 의존하지 않는 특징을 중심으로 형태 불변 특징을 강조하기 위해 자세 무관 모듈(Pose-Irrelevant Module, PIM)을 사용하여 회전 및 이동 정보를 억제한다.
  • RGB, 깊이, 학습된 형태 사전 정보 간의 관계적 특징을 모델링하기 위해 세 가지 별도의 그래프 기반 메시지 전달 메커니즘을 사용하는 관계 재구성 모듈(Relational Reconstruction Module, RRM)을 도입한다.
  • 재구성기는 융합된 특징에서 형태 사전 변형을 이용해 캐논리컬 표현을 재구성한다.
  • 재구성된 캐논리컬 표현의 현실성을 강제하기 위해 재구성기와 함께 적대적으로 훈련되는 판별기(Discriminator)를 사용한다.
  • 최종 6자리 자세는 재구성된 캐논리컬 표현을 깊이 관측값의 역투영과 정렬함으로써 Umeyama의 알고리즘을 통해 추정한다.
  • 적대적 훈련은 훈련 기간 동안만 적용되어 추론 효율성을 유지하면서도 재구성 정밀도를 향상시킨다.

실험 결과

연구 질문

  • RQ1카테고리 수준의 6자리 객체 자세 추정에서 적대적 훈련이 캐논리컬 3D 표현 재구성의 현실성과 품질을 향상시키는 데 효과적인가?
  • RQ2자세 무관 모듈이 자세에 의존하는 특징을 걸러내어 형태 특징 학습을 향상시키는 데 얼마나 효과적인가?
  • RQ3RGB, 깊이, 형태 사전 정보 간의 관계적 특징이 재구성 성능 향상에 어느 정도 기여하는가?
  • RQ4자르힘 및 가림과 같은 실제 환경 도전 과제 상황에서 제안된 방법은 어떻게 성능을 발휘하는가?

주요 결과

  • ACR-Pose는 카테고리 수준의 6자리 객체 자세 추정에서 합성 데이터셋인 NOCS-CAMERA와 실제 데이터셋인 NOCS-REAL에서 최신 기술 수준의 성능을 달성한다.
  • 절단 실험 결과, 세 입력 모odal 간 메시지 전달을 활용하는 관계 재구성 모듈을 추가함으로써 성능 향상이 확인되었다.
  • 자세 무관 모듈은 자세에 의존하는 특징을 걸러내어 모든 평가 지표를 1%에서 3% 향상시켰다.
  • 적대적 훈련은 뚜렷한 성능 향상을 가져왔으며, 더 현실적인 캐논리컬 표현이 후속 자세 정렬 성능 향상에 기여한다는 점을 확인했다.
  • 실패 사례는 주로 물체의 자르힘 또는 가림으로 인해 발생하여 실제 환경에서의 도전 상황에서의 한계를 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.