Skip to main content
QUICK REVIEW

[논문 리뷰] Leveraging SE(3) Equivariance for Self-Supervised Category-Level Object Pose Estimation

Xiaolong Li, Yijia Weng|arXiv (Cornell University)|2021. 10. 30.
3D Shape Modeling and Analysis참고 문헌 25인용 수 11
한 줄 요약

이 논문은 지정된 자세 레이블, CAD 모델, 다중화면 감독 없이도 학습하는 SE(3) 동변성(-equivariance)을 활용한 최초의 자기지도(category-level) 6D 물체 자세 추정 프레임워크를 제안한다. 형태와 자세를 SE(3)-불변 재구성 모듈과 SE(3)-동변성 자세 추정기로 분리함으로써, 카테고리 수준의 기준 프레임을 학습하고 ModelNet40 및 NOCS-REAL275에서 최신 기술 수준(SOTA) 성능을 달성하며, 일부 완전 지도 학습 방법과 정확도가 유사하다.

ABSTRACT

Category-level object pose estimation aims to find 6D object poses of previously unseen object instances from known categories without access to object CAD models. To reduce the huge amount of pose annotations needed for category-level learning, we propose for the first time a self-supervised learning framework to estimate category-level 6D object pose from single 3D point clouds.During training, our method assumes no ground-truth pose annotations, no CAD models, and no multi-view supervision. The key to our method is to disentangle shape and pose through an invariant shape reconstruction module and an equivariant pose estimation module, empowered by SE(3) equivariant point cloud networks.The invariant shape reconstruction module learns to perform aligned reconstructions, yielding a category-level reference frame without using any annotations. In addition, the equivariant pose estimation module achieves category-level pose estimation accuracy that is comparable to some fully supervised methods. Extensive experiments demonstrate the effectiveness of our approach on both complete and partial depth point clouds from the ModelNet40 benchmark, and on real depth point clouds from the NOCS-REAL 275 dataset. The project page with code and visualizations can be found at: https://dragonlong.github.io/equi-pose.

연구 동기 및 목표

  • 지정된 자세 레이블이 필요한 고비용 자세 추정 문제를 해결하기 위해 지정된 자세 레이블이 필요 없도록 하는 것.
  • CAD 모델이나 다중화면 감독이 제공되지 않는 자기지도 학습 환경에서 카테고리 수준 자세 추정을 가능하게 하는 것.
  • 자기지도 형태 재구성 과정을 통해 감독 없이도 카테고리 수준의 기준 프레임을 암묵적으로 발견하는 것.
  • 자기지도 설정에서 완전 지도 학습 방법과 비교할 만한 경쟁력 있는 자세 추정 정확도를 달성하는 것.

제안 방법

  • 회전 및 이동된 부분 점군으로부터 표준형(shape)을 재구성하기 위해 SE(3)-불변 신경망을 사용하며, 정렬을 통해 카테고리 수준의 기준 프레임을 학습한다.
  • 재구성된 형상을 입력 관측 공간으로 변환하는 6D 물체 자세를 예측하기 위해 SE(3)-동변성 신경망을 활용한다.
  • 예측된 재구성 결과를 추정된 자세로 변환한 후 입력 점군과 비교함으로써 일관성 손실를 구성한다.
  • 형태 재구성 모듈은 SE(3) 변환에 대해 불변성을 보장하고, 자세 모듈은 동변성을 보장함으로써 형태와 자세를 분리한다.
  • 지정된 자세나 CAD 모델에 접근할 수 없이도 단일 화면 깊이 점군만을 사용하여 엔드 투 엔드로 프레임워크를 학습한다.
  • 재구성 일관성에 기반한 자기지도 학습을 통해 공통된 카테고리 수준의 좌표 공간을 학습할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1지정된 자세 레이블이 전혀 없는 상태에서 자기지도 프레임워크가 카테고리 수준의 기준 프레임을 학습할 수 있는가?
  • RQ2SE(3) 동변성과 불변성이 자기지도 방식으로 형태와 자세를 효과적으로 분리하는 데 활용될 수 있는가?
  • RQ3이러한 방법이 CAD 모델 없이도 합성 및 실제 세계 벤치마크에서 경쟁력 있는 자세 추정 정확도를 달성할 수 있는가?
  • RQ4이러한 방법은 동일 카테고리에 属하는 새로운, 미리 보지 않은 물체 인스턴스로 일반화되는가?

주요 결과

  • 이 방법은 지정된 자세 레이블 없이도 자기지도 학습만으로 ModelNet40 벤치마크에서 카테고리 수준 6D 물체 자세 추정에서 최신 기술 수준 성능을 달성한다.
  • NOCS-REAL275 실세계 데이터셋에서, 부분적이고 노이즈가 있는 깊이 점군에서도 정확한 자세 예측을 생성한다.
  • 다양한 물체 인스턴스와 자세 간에 표준형 재구성이 잘 정렬되어 있어 일관된 카테고리 수준 기준 프레임이 암묵적으로 형성됨을 보여준다.
  • 자세 레이블이 전혀 없는 조건에서 학습되었음에도 불구하고, 일부 완전 지도 학습 방법과 유사한 정확도를 달성한다.
  • YCB-Video 데이터셋에서 ICP-60보다 자기지도 인스턴스 수준 자세 추정에서 성능이 뛰어나며, 회전 오차와 이동 오차가 모두 낮다.
  • 대칭적이고 무늬가 있는 물체를 포함한 새로운 인스턴스로도 잘 일반화되며, 정성적 및 정량적 평가를 통해 이를 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.