Skip to main content
QUICK REVIEW

[논문 리뷰] UprightNet: Geometry-Aware Camera Orientation Estimation from Single Images

Wenqi Xian, Zhengqi Li|arXiv (Cornell University)|2019. 08. 19.
Advanced Vision and Imaging참고 문헌 47인용 수 9
한 줄 요약

UprightNet은 로컬 카메라 좌표계와 글로벌 우범좌표계에서 표면 기하를 예측함으로써, 미분 가능한 최소 제곱법을 통해 최적의 회전을 구해 2D 카메라 자세(피치 및 롤)를 단일 RGB 이미지에서 추정하는 기하 인식 딥러닝 프레임워크를 제안한다. 이는 국소 및 글로벌 표면 프레임 간 기하 일致성을 명시적으로 모델링함으로써 합성 및 실세계 실내 데이터셋에서 최신 기술 대비 뛰어난 정확도와 일반화 성능을 달성한다.

ABSTRACT

We introduce UprightNet, a learning-based approach for estimating 2DoF camera orientation from a single RGB image of an indoor scene. Unlike recent methods that leverage deep learning to perform black-box regression from image to orientation parameters, we propose an end-to-end framework that incorporates explicit geometric reasoning. In particular, we design a network that predicts two representations of scene geometry, in both the local camera and global reference coordinate systems, and solves for the camera orientation as the rotation that best aligns these two predictions via a differentiable least squares module. This network can be trained end-to-end, and can be supervised with both ground truth camera poses and intermediate representations of surface geometry. We evaluate UprightNet on the single-image camera orientation task on synthetic and real datasets, and show significant improvements over prior state-of-the-art approaches.

연구 동기 및 목표

  • 딥러닝 모델이 블랙박스 회귀에 의존하는 것 대신 명시적인 기하 합리성을 통합하여 단일 RGB 이미지에서 2D 카메라 자세 추정을 향상시키기 위해.
  • 기존 학습 기반 방법이 기하 유도 편향을 결여하여 일반화 성능이 떨어지고 해석이 어려운 문제를 해결하기 위해.
  • 로컬(카메라) 및 글로벌(우범) 좌표계에서 표면 기하를 동시에 예측하여 자세 추정을 위한 기하 정렬을 가능하게 하는 프레임워크를 개발하기 위해.
  • 중간 기하 표현과 최종 자세 출력 모두에 대한 감독을 통해 엔드 투 엔드 훈련을 가능하게 하여 강인성과 성능을 향상시키기 위해.

제안 방법

  • 네트워크는 로컬 카메라 및 글로벌 우범 좌표계에서 표면 법선, 탄젠트 벡터, 바이텀 벡터의 세 가지 기하 표현을 예측한다.
  • 카메라 자세 추정 문제를 로컬 표면 프레임과 글로벌 프레임을 정렬하는 미분 가능한 최소 제곱 문제로 공식화한다.
  • 예측된 가중치 맵을 사용해 신뢰도가 낮은 기하 예측을 억제함으로써 노이즈 또는 모호한 영역에 대한 강인성을 향상시킨다.
  • 다중 작업 감독을 통해 훈련: 최종 자세 오차뿐만 아니라 중간 기하 표현(예: 표면 법선 및 탄젠트 평면)에도 감독을 적용한다.
  • 기하 정렬 모듈을 통해 역전파가 가능한 엔드 투 엔드 미분 가능 프레임워크이다.
  • 수직 벽과 수직 바닥의 기하 사전 지식을 포함한 기하 우선 사항을 캐릭터화하는 표면 프레임을 중간 표현으로 활용한다.

실험 결과

연구 질문

  • RQ1명시적인 기하 합리성은 단일 이미지 기반 카메라 자세 추정을 위한 딥러닝 모델의 정확도와 일반화 성능을 향상시키는가?
  • RQ2로컬 및 글로벌 기하 표현을 함께 통합하는 것이 원시 픽셀에서의 학습과 비교해 자세 추정 성능을 향상시키는가?
  • RQ3미분 가능한 기하 정렬 모듈을 사용할 경우 직접 회귀 기반 모델에 비해 성능 향상이 어느 정도 이루어지는가?
  • RQ4표면 기하 표현에 대한 중간 감독이 새로운 실내 환경에 대한 일반화 성능 향상에 기여하는가?
  • RQ5예를 들어 법선 및 탄젠트 평면과 같은 구조화된 기하 특징을 사용할 경우, 구조가 제한된 어려운 환경에서도 강인성이 향상되는가?

주요 결과

  • UprightNet은 InteriorNet 테스트 세트에서 평균 1.17°, 중앙값 0.52°의 각도 오차를 기록하여 이전 최신 기술 대비 뚜렷한 승리 기록을 달성했다.
  • SUN360 데이터셋에서 UprightNet은 잘 일반화되며 평균 각도 오차 7.81°를 기록하여 CNN 회귀(10.43°) 및 DeepHorizon(9.53°)를 모두 앞서나갔다.
  • 절단 실험 결과, 국소 또는 글로벌 기하 감독을 제거할 경우 오차가 증가함을 확인하여 双프레임 기하 예측의 중요성을 입증했다.
  • F^c 및 F^u 감독과 가중치 맵을 모두 포함한 전체 모델은 기하 감독이 없는 절단 모델 대비 각도 오차를 40% 감소시켰다.
  • 시험된 unseen SUN360 데이터에서, 다음으로 우수한 방법 대비 평균 각도 오차에서 25%의 상대적 향상도를 보이며 강력한 일반화 성능을 입증했다.
  • 구조적 단서가 부족한 환경(예: 평평한 벽 또는 균일한 바닥)에서는 실패 케이스가 발생함을 확인하여, 퇴화점 또는 알려진 내부 매개변수와 같은 추가 기하 사전 지식이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.