Skip to main content
QUICK REVIEW

[논문 리뷰] RePOSE: Real-Time Iterative Rendering and Refinement for 6D Object Pose Estimation.

Shun Iwase, Xingyu Liu|arXiv (Cornell University)|2021. 04. 01.
Human Pose and Action Recognition인용 수 8
한 줄 요약

RePOSE는 깊이 있는 신경망을 사용한 특징 이미지 렌더링을 위해 얕은 다층 퍼셉트론을 직접 사용함으로써 반복적 자세 보정의 계산 비용을 줄이는 실시간 6자유도 물체 자세 추정 방법을 제안한다. 이는 비용이 많이 드는 CNN 추론을 회피한다. Occlusion LineMOD 데이터셋에서 71 FPS와 51.6%의 정확도를 달성하여 이전 방법 대비 4.1%p의 절대적 향상률을 보였다.

ABSTRACT

The use of iterative pose refinement is a critical processing step for 6D object pose estimation, and its performance depends greatly on one's choice of image representation. Image representations learned via deep convolutional neural networks (CNN) are currently the method of choice as they are able to robustly encode object keypoint locations. However, CNN-based image representations are computational expensive to use for iterative pose refinement, as they require that image features are extracted using a deep network, once for the input image and multiple times for rendered images during the refinement process. Instead of using a CNN to extract image features from a rendered RGB image, we propose to directly render a deep feature image. We call this deep texture rendering, where a shallow multi-layer perceptron is used to directly regress a view invariant image representation of an object. Using an estimate of the pose and deep texture rendering, our system can render an image representation in under 1ms. This image representation is optimized such that it makes it easier to perform nonlinear 6D pose estimation by adding a differentiable Levenberg-Marquardt optimization network and back-propagating the 6D pose alignment error. We call our method, RePOSE, a Real-time Iterative Rendering and Refinement algorithm for 6D POSE estimation. RePOSE runs at 71 FPS and achieves state-of-the-art accuracy of 51.6% on the Occlusion LineMOD dataset - a 4.1% absolute improvement over the prior art, and comparable performance on the YCB-Video dataset with a much faster runtime than the other pose refinement methods.

연구 동기 및 목표

  • 반복적 6자유도 자세 보정에서 CNN 기반 특징 추출의 계산 병목 현상을 해결하기 위해.
  • 정확도를 희생시키지 않고도 실시간 성능을 달성하기 위해.
  • 素早く 렌더링할 수 있고 종단 간 최적화가 가능한 视점 불변 이미지 표현을 개발하기 위해.
  • 직접 6자유도 자세 보정을 가능하게 하기 위해 미분 가능한 최적화를 렌더링 파이프라인에 통합하기 위해.

제안 방법

  • 물체 기하학과 자세에서 직접 깊이 특징 이미지를 회귀하기 위해 깊이 있는 신경망을 사용한 특징 추출을 얕은 다층 퍼셉트론으로 대체한다.
  • 깊이 있는 무늬 렌더링을 사용하여 1ms 이내로 시점 불변 이미지 표현을 생성한다.
  • 6자유도 자세 정렬 오차를 역전파하기 위해 미분 가능한 Levenberg-Marquardt 최적화 네트워크를 통합한다.
  • 렌더링된 특징과 진짜 키포인트 위치 간의 차이를 최소화함으로써 자세 추정을 최적화한다.
  • 종단 간 훈련이 가능한 미분 가능한 렌더링 파이프라인을 활용하여 자세 보정 과정을 종합적으로 최적화한다.
  • 렌더링된 이미지에 대해 반복적인 CNN 추론을 피하기 위해 반복마다 단일 순방향 전파를 활용한다.

실험 결과

연구 질문

  • RQ1정확도를 유지하면서 반복적 6자유도 자세 보정에서 CNN을 대체할 수 있는 경량 신경망을 사용할 수 있는가?
  • RQ2직접적인 깊이 특징 렌더링이 6자유도 자세 추정에서 실시간 성능을 가능하게 할 수 있는가?
  • RQ3미분 가능한 렌더링 파이프라인을 통한 자세의 미분 가능한 최적화가 수렴성과 정확도를 어떻게 향상시키는가?
  • RQ4CNN 기반 특징을 학습된 무늬 렌더링으로 대체할 경우 속도와 정확도 사이의 상충 관계는 어떠한가?
  • RQ5제안된 방법이 Occlusion LineMOD 및 YCB-Video와 같은 도전적인 벤치마크에 일반화될 수 있는가?

주요 결과

  • RePOSE는 71 FPS의 추론 속도를 달성하여 실시간 6자유도 자세 추정을 가능하게 한다.
  • Occlusion LineMOD 데이터셋에서 51.6%의 정확도를 달성하여 이전 최상의 방법 대비 4.1%p의 절대적 향상률을 기록한다.
  • YCB-Video 데이터셋에서도 경쟁적인 성능를 유지하면서 다른 보정 기반 접근 방식에 비해 뚜렷한 런타임 성능 향상을 보인다.
  • 직접적인 깊이 있는 무늬 렌더링을 사용함으로써 반복당 추론 시간을 1ms 이내로 줄여 반복적인 CNN 추론이 필요 없어졌다.
  • 미분 가능한 최적화 파이프라인을 통해 역전파된 정렬 오차를 통해 효과적인 종단 간 자세 추정 보정이 가능하다.
  • 표준 벤치마크에서 검증된 바와 같이, 부분적 가림 및 비가림 상황 모두에 대해 강력한 일반화 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.