Skip to main content
QUICK REVIEW

[논문 리뷰] CGA-PoseNet: Camera Pose Regression via a 1D-Up Approach to Conformal Geometric Algebra

Alberto Pepe, Joan Lasenby|arXiv (Cornell University)|2023. 02. 10.
Optical measurement and interference techniques인용 수 4
한 줄 요약

CGA-PoseNet는 회전과 이동을 단일 모터 표현으로 통합하는 1D-Up 접근 방식을 사용한 conformal geometric algebra(CGA)를 활용한 새로운 카메라 자세 회귀 방법을 제안한다. 이는 간단한 평균 제곱 오차(MSE) 손실을 사용한 엔드 투 엔드 학습을 가능하게 하며, 3D 점 애너테이션이나 복잡한 손실 가중치 설정이 필요 없이 이미지 전용 데이터셋에서 최신 기술 수준의 정확도를 달성한다.

ABSTRACT

We introduce CGA-PoseNet, which uses the 1D-Up approach to Conformal Geometric Algebra (CGA) to represent rotations and translations with a single mathematical object, the motor, for camera pose regression. We do so starting from PoseNet, which successfully predicts camera poses from small datasets of RGB frames. State-of-the-art methods, however, require expensive tuning to balance the orientational and translational components of the camera pose.This is usually done through complex, ad-hoc loss function to be minimized, and in some cases also requires 3D points as well as images. Our approach has the advantage of unifying the camera position and orientation through the motor. Consequently, the network searches for a single object which lives in a well-behaved 4D space with a Euclidean signature. This means that we can address the case of image-only datasets and work efficiently with a simple loss function, namely the mean squared error (MSE) between the predicted and ground truth motors. We show that it is possible to achieve high accuracy camera pose regression with a significantly simpler problem formulation. This 1D-Up approach to CGA can be employed to overcome the dichotomy between translational and orientational components in camera pose regression in a compact and elegant way.

연구 동기 및 목표

  • 기존에 복잡한 데이터세트 특화 손실 가중치 설정이 필요로 하는 카메라 자세 회귀에서 방향성과 이동성 성분의 균형을 맞추는 과제를 해결하기 위해.
  • 1D-Up 구조를 사용한 conformal geometric algebra(CGA)를 활용해 회전과 이동을 단일 수학적 객체인 '모터'로 통합하기 위해.
  • 3D 점 애너테이션이나 기하 재투영 손실 없이도 RGB 이미지와 단순한 MSE 손실만으로 고정밀 카메라 자세 회귀를 가능하게 하기 위해.
  • CGA에서 잘 정의된 4차원 유클리드 공간 표현이 작은 데이터셋에서의 훈련을 단순화하고 일반화 성능을 향상시킨다는 것을 입증하기 위해.

제안 방법

  • 1D-Up conformal geometric algebra에서 카메라 자세를 모터로 표현하며, 모든 기저 벡터가 +1의 제곱을 가지는 4차원 유클리드 서명을 가진 공간이다.
  • 회전과 이동을 모두 포함하는 단일 8개 파라미터 모터를 사용하여 방향과 위치에 대한 별도의 표현이 필요 없도록 한다.
  • 예측된 모터와 진짜 모터 간의 표준 평균 제곱 오차(MSE) 손실을 적용함으로써, 복잡한 수작업 손실 가중치 설정 방식을 피한다.
  • 3D 장면 기하학 정보가 필요 없이 RGB 이미지 입력에서 직접 모터를 회귀하기 위해 수정된 PoseNet 아키텍처를 훈련시킨다.
  • 포인트 클라우드를 동치 변환을 통해 구면 공간으로 투영하여, 재구성된 포인트 클라우드 간의 MSE를 통해 자세 정확도를 검증한다.
  • 모터 적용 및 오차 측정 중 기하학적 정확도를 유지하기 위해 구면 공간 변환(Eq. 13)을 사용한다.

실험 결과

연구 질문

  • RQ1Conformal Geometric Algebra에서 단일 모터 표현을 사용함으로써, 기존의 카메라 자세 회귀에서 회전과 이동 간의 별도 손실 가중치 설정이 필요 없어지는가?
  • RQ2유클리드 서명을 가진 1D-Up CGA 프레임워크는 표준 MSE 손실을 사용해 더 단순하고 강력한 훈련을 가능하게 하는가?
  • RQ33D 점 애너테이션 없이도 RGB 이미지와 모터 회귀만으로 고정밀 카메라 자세 회귀가 가능한가?
  • RQ43D 점을 사용한 기하 재투영 손실을 적용한 최신 기술 대비 모터 기반 접근 방식의 성능은 어떠한가?

주요 결과

  • CGA-PoseNet는 3D 점 애너테이션 없이도 RGB 이미지와 단순한 MSE 손실만으로 13개의 벤치마크 데이터셋에서 최신 기술 수준의 정확도를 달성한다.
  • Cambridge Landmarks 데이터셋 등 200만 개 이상의 3D 점을 요구하는 기하 재투영 손실을 사용하는 방법들보다도 우수하거나 동등한 성능을 보인다.
  • 위치 오차와 회전 오차 사이에 높은 상관관계가 존재하여, 두 성분 모두에서 모터 표현의 일관성이 확인된다.
  • 포인트 클라우드 재구성 실험 결과, 예측된 포인트 클라우드와 진짜 포인트 클라우드 간의 MSE가 표에 기재된 위치 오차와 일치함을 확인하여 예측된 모터의 기하학적 정확도가 검증된다.
  • 간단한 구조에도 불구하고, 모델 불확실성을 포함한 [20]과 LSTM 헤드를 추가한 [48]보다도 뛰어난 성능을 낸다.
  • King’s 및 Shop Facade와 같은 랜드마크에 대한 재구성된 포인트 클라우드 간의 중앙값 MSE가 낮고 일관되며, 표기된 자세 오차와도 부합함을 확인하여 다양한 시나리오에서의 강건성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.