Skip to main content
QUICK REVIEW

[논문 리뷰] StereoPose: Category-Level 6D Transparent Object Pose Estimation from Stereo Images via Back-View NOCS

Kai Chen, Stephen James|arXiv (Cornell University)|2022. 11. 03.
Robotics and Sensor-Based Localization인용 수 4
한 줄 요약

StereoPose는 깊이 맵을 사용하지 않고 스테레오 이미지 기반의 프레임워크를 제안하여 투명 물체의 카테고리 수준 6D 자세 추정을 수행한다. 이는 이미지 콘텐츠 앨리어싱과 자기 음영으로 인한 모호성을 줄이기 위해 새로운 뒷면 NOCS 맵을 활용한다. 시야 간 시차 인식 스테레오 특징 융합, 에피포라 기하학 손실, 그리고 세 단계 파이프라인(크기 추정, 초도 자세 추정, 보정)을 통해 깊이 맵 없이도 TOD 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Most existing methods for category-level pose estimation rely on object point clouds. However, when considering transparent objects, depth cameras are usually not able to capture meaningful data, resulting in point clouds with severe artifacts. Without a high-quality point cloud, existing methods are not applicable to challenging transparent objects. To tackle this problem, we present StereoPose, a novel stereo image framework for category-level object pose estimation, ideally suited for transparent objects. For a robust estimation from pure stereo images, we develop a pipeline that decouples category-level pose estimation into object size estimation, initial pose estimation, and pose refinement. StereoPose then estimates object pose based on representation in the normalized object coordinate space~(NOCS). To address the issue of image content aliasing, we further define a back-view NOCS map for the transparent object. The back-view NOCS aims to reduce the network learning ambiguity caused by content aliasing, and leverage informative cues on the back of the transparent object for more accurate pose estimation. To further improve the performance of the stereo framework, StereoPose is equipped with a parallax attention module for stereo feature fusion and an epipolar loss for improving the stereo-view consistency of network predictions. Extensive experiments on the public TOD dataset demonstrate the superiority of the proposed StereoPose framework for category-level 6D transparent object pose estimation.

연구 동기 및 목표

  • 반사성 및 반사성 재료로 인해 깊이 맵 품질이 열 劣화되는 투명 물체에 대한 카테고리 수준 6D 자세 추정 문제를 해결하기 위해.
  • 깊이 데이터에 심각한 아티팩트가 발생하여 투명 물체에서 실패하는 기존의 포인트 클라우드 기반 방법의 한계를 극복하기 위해.
  • 앞면 이미지에 뒷면의 물체 구조가 나타나는 이미지 콘텐츠 앨리어싱으로 인한 학습 모호성을 줄이기 위해.
  • 일반적으로 앞면만 고려하는 표현 방식에서 무시되는 투명 물체의 뒷면 정보(예: 손잡이, 가장자리 등)를 활용하기 위해.
  • 깊이 맵이나 고품질 포인트 클라우드에 의존하지 않고도 강건하고 정확한 자세 추정을 수행할 수 있는 스테레오 이미지 기반 프레임워크를 개발하기 위해.

제안 방법

  • 프레임워크는 카테고리 수준 자세 추정을 세 단계로 분리한다: 물체 크기 추정, 초도 자세 추정, 자세 보정.
  • 투명 물체의 뒷면에 대한 조밀한 대응 관계를 모델링하기 위해 뒷면 NOCS 맵을 도입하여 앨리어싱된 이미지 콘텐츠로 인한 모호성을 줄인다.
  • 기하학적 시차를 가이던스 신호로 사용하는 시차 인식 어텐션 모듈이 스테레오 특징을 융합하여 시야 간 특징 일관성을 향상시킨다.
  • 에피포라 기하학 손실은 에피포라 제약 조건을 통해 대응하는 점을 정렬시켜 왼쪽 및 오른쪽 시야의 NOCS 예측 간 일관성을 강제한다.
  • 스테레오 RGB 이미지에서 앞면 및 뒷면 NOCS 맵을 동시에 예측하여 전체 대응 정확도를 향상시킨다.
  • 명시적인 깊이 맵 사용을 피하고, 대신 스테레오 기하학과 NOCS 표현을 활용하여 강건한 6D 자세 추정을 수행한다.

실험 결과

연구 질문

  • RQ1깊이 맵을 사용하지 않고도 스테레오 이미지 기반 프레임워크가 투명 물체의 정확한 카테고리 수준 6D 자세 추정을 수행할 수 있는가?
  • RQ2뒷면 NOCS 맵을 도입함으로써 투명 물체에서 이미지 콘텐츠 앨리어싱으로 인한 학습 모호성이 얼마나 감소하는가?
  • RQ3표준 스테레오 융합 대비 시차 인식 스테레오 특징 융합이 자세 추정 정확도에 얼마나 기여하는가?
  • RQ4에피포라 기하학 손실이 스테레오 시야 간 NOCS 예측 일관성 향상에 얼마나 효과적인가?
  • RQ5뒷면 구조적 특징(예: 손잡이, 가장자리 등)이 투명 물체 자세 추정 정확도에 기여하는 정도는 어느 정도인가?

주요 결과

  • 제안된 StereoPose 프레임워크는 TOD 데이터셋에서 3D IoU@25가 97.9%를 기록하여 기준 방법들을 크게 앞서간다.
  • 뒷면 NOCS 맵을 제거하면 3D IoU@25가 9.6% 감소하여, 이는 뒷면 구조적 특징을 다루는 데서 중요한 역할을 함을 입증한다.
  • 시차 인식 어텐션 모듈을 도입함으로써 기준 방법보다 3D IoU@25가 4.2% 향상되었으며, 이는 스테레오 융합의 효과를 보여준다.
  • 에피포라 기하학 손실을 제거할 경우 3D IoU@25가 3.5% 증가하여, 이는 스테레오 일관성 강제에 효과적임을 시사한다.
  • 전체 모델은 3D IoU@50가 77.4%이며 10°10cm 정확도가 38.2%를 기록하여, 모든 메트릭에서 아블레이션 변형보다 뛰어난 성능을 보였다.
  • 정성적 결과는 뒷면 NOCS 맵이 손잡이 및 기타 뒷면 기능의 정확한 국소화를 가능하게 하여 어려운 구성에서의 자세 오차를 감소시킴을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.