Skip to main content
QUICK REVIEW

[논문 리뷰] Direct-PoseNet: Absolute Pose Regression with Photometric Consistency

Shuai Chen, Zirui Wang|arXiv (Cornell University)|2021. 04. 08.
Advanced Vision and Imaging참고 문헌 57인용 수 6
한 줄 요약

Direct-PoseNet는 광학적 일치 모듈을 기반으로 한 미분 가능 렌더링을 통합하여 사진적 일관성을 위한 감독을 제공함으로써 정확도를 향상시키는 새로운 단일 이미지 절대 자세 회귀 방법을 제안한다. 이는 자세와 이미지 재구성 손실을 모두 활용한 엔드 투 엔드 훈련을 가능하게 하며, 7-Scenes 및 LLFF 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다. 이는 이전의 APR 방법들을 능가하면서도 낮은 추론 지연을 유지한다.

ABSTRACT

We present a relocalization pipeline, which combines an absolute pose regression (APR) network with a novel view synthesis based direct matching module, offering superior accuracy while maintaining low inference time. Our contribution is twofold: i) we design a direct matching module that supplies a photometric supervision signal to refine the pose regression network via differentiable rendering; ii) we modify the rotation representation from the classical quaternion to SO(3) in pose regression, removing the need for balancing rotation and translation loss terms. As a result, our network Direct-PoseNet achieves state-of-the-art performance among all other single-image APR methods on the 7-Scenes benchmark and the LLFF dataset.

연구 동기 및 목표

  • 단일 이미지 절대 자세 회귀(APR)와 3D 구조 기반 방법 사이의 정확도 격차를 해소하기 위해, 깊이 또는 SfM 데이터가 필요한 경우가 많은 기존 방법의 한계를 보완한다.
  • 시각 온도미터나 자세 그래프 최적화와 같은 외부 감독을 기반으로 하지 않고도 APR 성능을 향상시키는 것을 목표로 한다.
  • 훈련 중에 사진적 일관성을 감독 신호로 통합하여 자세 회귀의 강건성을 향상시키는 것.
  • 자기 지율적 사진적 손실을 통해 레이블이 없는 데이터를 효과적으로 활용함으로써, 추가 애너테이션 없이 일반화 능력을 향상시키는 것.

제안 방법

  • 자세 회귀 네트워크는 전이 학습을 통해 미세조정된 CNN 기반 백본을 사용하여 단일 RGB 이미지에서 6-DoF 카메라 자세를 예측한다.
  • 미분 가능 신경 렌더링 모듈은 예측된 자세를 사용하여 3D 장면의 새로운 시점을 합성하여 사진적 감독을 위한 합성 이미지를 생성한다.
  • 이 방법은 진짜 자세 손실과 입력 쿼리 이미지 및 렌더링된 이미지 간의 사진적 재구성 손실을 조합한 다중 손실 훈련 목표를 사용한다.
  • 사진적 일관성은 이미지 유사도 기울기를 통해 자세 예측을 정교화할 수 있도록, 기울기 전파가 가능한 렌더링 파이프라인을 통해 강제로 구현된다.
  • 직접 매칭 모듈은 쿼리 이미지와 렌더링된 시점 간의 사진적 오차를 최소화함으로써, 레이블이 없는 이미지를 자기 지율적 감독에 활용할 수 있도록 한다.
  • 훈련 과정은 엔드 투 엔드이며, 사진적 손실을 통해 렌더링 네트워크를 거쳐 자세 회귀기로 기울기가 전파된다.

실험 결과

연구 질문

  • RQ1미분 가능 렌더링를 통한 사진적 일관성은 단일 이미지 절대 자세 회귀의 정확도를 향상시킬 수 있는가?
  • RQ2상대 자세나 기하학적 제약 조건이 필요 없이도 레이블이 없는 이미지를 APR에 효과적으로 활용할 수 있는가?
  • RQ3직접 이미지 매칭 감독을 통합하면 표준 자세 회귀 손실만을 사용할 때보다 더 나은 일반화와 강건성을 달성할 수 있는가?
  • RQ4직접 매칭 모듈은 낮은 추론 시간을 유지하면서도 APR에서 최신 기술 수준 성능을 달성할 수 있는가?

주요 결과

  • Direct-PoseNet는 7-Scenes 벤치마크에서 최신 기술 수준 성능을 달성하였으며, 레이블이 없는 데이터를 사용하여 평균 중앙값 이동 오차를 0.16m로 줄이고, 회전 오차를 5.17°로 감소시켰다.
  • LLFF 데이터셋에서 기존의 단일 이미지 APR 방법들을 능가하며, 다양한 장면에 걸쳐 강력한 일반화 능력을 보였다.
  • 사진적 손실의 통합은 무늬가 적고 배경이 평평한 장면, 예를 들어 NeRF Synthetic의 Lego 장면에서 특히 효과적이었으며, 이 경우 자세 손실만으로는 예측을 정규화하지 못했다.
  • 기본 손실 가중치(λ₁=0.3, λ₂=0.7) 설정에서도 사진적 손실이 훈련에서 지배적인 역할을 하며, 자세 보정을 이끄는 효과성을 입증했다.
  • 낮은 추론 시간을 유지하여, 이미지당 6ms 이내로 작동하여 실시간 배포에 적합하다.
  • 단절 실험 결과는 자세 손실과 사진적 손실 둘 다 필수적임을 확인하였으며, 둘 중 하나를 제거하면 특히 도전적인 장면에서 성능 저하가 발생했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.