Skip to main content
QUICK REVIEW

[논문 리뷰] Pose-GNN : Camera Pose Estimation System Using Graph Neural Networks

Ahmed Elmoogy, Xiaodai Dong|arXiv (Cornell University)|2021. 03. 17.
Robotics and Sensor-Based Localization참고 문헌 45인용 수 5
한 줄 요약

이 논문은 사전 훈련된 ResNet50 특징을 활용하여 국소화 정확도를 향상시키기 위해 그래프 신경망(GNNs)을 사용하는 새로운 카메라 자세 추정 시스템인 Pose-GNN을 제안한다. 이미지를 그래프의 노드로 모델링하는 방식(Node-pose)과 이미지 특징을 그래프로 간주하는 방식(Graph-pose)의 두 가지 접근법을 도입하였으며, ImageNet 특징을 사용할 경우 7 Scenes 데이터셋에서 중앙값 위치 오차 0.18m, 자세 오차 7.5°를 기록하여 최신 기술(SOTA) 수준의 성능을 달성함을 입증하였다.

ABSTRACT

We propose a novel image based localization system using graph neural networks (GNN). The pretrained ResNet50 convolutional neural network (CNN) architecture is used to extract the important features for each image. Following, the extracted features are input to GNN to find the pose of each image by either using the image features as a node in a graph and formulate the pose estimation problem as node pose regression or modelling the image features themselves as a graph and the problem becomes graph pose regression. We do an extensive comparison between the proposed two approaches and the state of the art single image localization methods and show that using GNN leads to enhanced performance for both indoor and outdoor environments.

연구 동기 및 목표

  • 기존의 회귀 헤드 대신 그래프 신경망을 사용하여 단일 이미지 기반 카메라 자세 추정 정확도를 향상시키는 것.
  • 이미지를 노드로 모델링하는 것과 이미지 특징을 그래프로 모델링하는 것이 자세 추정 성능에 미치는 영향을 비교하는 것.
  • 실내 및 실외 국소화 환경에서 다양한 사전 훈련된 특징 기반 모델(Imagenet 대비 Places)의 영향을 평가하는 것.
  • 다양한 환경에서 그래프 구축을 위한 최적의 이웃 선택 전략을 규명하는 것.
  • 사전 훈련된 특징을 사용할 경우 ResNet50의 미세조정이 불필요하다는 것을 입증하는 것.

제안 방법

  • 각 이미지의 사전 훈련된 ResNet50 네트워크의 두 번째로 마지막 레이어에서 특징을 추출한다.
  • 이미지 간 특징 유사도를 기반으로 가장 가까운 이웃들 간에 연결된 그래프를 구축한다.
  • 노드-자세 방식에서 노드 특징에서 카메라 자세를 회귀하기 위해 ConvGNN(그래프 컬러레이션 네트워크)를 적용한다.
  • ResNet50의 중간 특징 맵을 공간적으로 가까운 특징들 간에 연결하여 그래프로 표현하고, 그래프 수준의 자세 회귀를 위해 GNN을 적용한다.
  • 자세 회귀를 위해 평균 제곱오차 손실을 사용하여 GNN을 엔드 투 엔드로 훈련한다.
  • 다양한 이웃 수(k)를 사용하여 실내 및 실외 환경에서의 민감도와 최적 설정을 분석한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 특징과 함께 그래프 신경망을 사용할 경우, 기존의 표준 회귀 헤드에 비해 카메라 자세 추정 정확도가 향상되는가?
  • RQ2이미지를 그래프의 노드로 모델링하는 것이 이미지 특징을 그래프로 모델링하는 것보다 자세 추정 성능에서 더 효과적인가?
  • RQ3사전 훈련된 특징 기반 모델의 선택(Imagenet 대비 Places)이 실내 및 실외 환경에서 성능에 미치는 영향은 어떠한가?
  • RQ4다양한 환경에서 그래프 구축을 위한 최적의 이웃 수는 얼마인가?
  • RQ5GNN을 사용할 경우 ResNet50 기반 모델의 미세조정을 피할 수 있는가?

주요 결과

  • 노드-자세 방식은 7 Scenes 데이터셋에서 모든 최신 기술(SOTA) 방법을 능가하며, ImageNet 특징을 사용할 경우 중앙값 위치 오차 0.18m, 자세 오차 7.5°를 기록하였다.
  • 실외 환경에서는 Places로 사전 훈련된 특징이 더 뛰어난 성능을 보였으며, 중앙값 자세 오차 3.76°를 기록하여 PN-L-W 및 LSTM과 같은 다른 방법들을 압도하였다.
  • 그래프-자세 방식 역시 7 Scenes 데이터셋에서 모든 다른 방법보다 뛰어난 성능을 보였지만, 특히 실외 환경에서는 노드-자세 방식에 비해 성능이 떨어졌다.
  • 실내 환경에서는 높은 이웃 수(예: 35개 이상)가 유리한 반면, 실외 환경에서는 낮은 이웃 수(10개 이하)가 가장 우수한 성능을 보였다. 이는 실외 환경에서 이미지 간 거리가 더 크기 때문이다.
  • 이웃과 다른 가중치를 가진 중심 노드 특징을 사용하면 학습 안정성과 성능 향상에 기여한다.
  • ResNet50 기반 모델의 미세조정 없이도 뛰어난 성능을 달성하였으며, 이는 고정된 사전 훈련된 특징과 GNN의 조합이 효과적이라는 점을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.