Skip to main content
QUICK REVIEW

[논문 리뷰] Where am I looking at? Joint Location and Orientation Estimation by Cross-View Matching

Yujiao Shi, Xin Yu|arXiv (Cornell University)|2020. 05. 08.
Advanced Image and Video Retrieval Techniques참고 문헌 21인용 수 10
한 줄 요약

이 논문은 동적 유사도 매칭(DSM) 네트워크를 사용하여 교차 뷰 지오로컬라이제이션을 위한 공동 위치 및 방향 추정 방법을 제안한다. 공중 영상에 원형 변환을 적용하여 도메인 갭을 줄이고, 지면 및 변환된 공중 영상의 특징을 애지머스 각도에 따라 상관관계화함으로써, CVUSA 데이터셋에서 방향이 알려지지 않은 180° 시야각 이미지의 경우 상위 1위 위치 재현율이 최대 6배 향상되는 등 상당한 성능 향상을 달성한다.

ABSTRACT

Cross-view geo-localization is the problem of estimating the position and orientation (latitude, longitude and azimuth angle) of a camera at ground level given a large-scale database of geo-tagged aerial (e.g., satellite) images. Existing approaches treat the task as a pure location estimation problem by learning discriminative feature descriptors, but neglect orientation alignment. It is well-recognized that knowing the orientation between ground and aerial images can significantly reduce matching ambiguity between these two views, especially when the ground-level images have a limited Field of View (FoV) instead of a full field-of-view panorama. Therefore, we design a Dynamic Similarity Matching network to estimate cross-view orientation alignment during localization. In particular, we address the cross-view domain gap by applying a polar transform to the aerial images to approximately align the images up to an unknown azimuth angle. Then, a two-stream convolutional network is used to learn deep features from the ground and polar-transformed aerial images. Finally, we obtain the orientation by computing the correlation between cross-view features, which also provides a more accurate measure of feature similarity, improving location recall. Experiments on standard datasets demonstrate that our method significantly improves state-of-the-art performance. Remarkably, we improve the top-1 location recall rate on the CVUSA dataset by a factor of 1.5x for panoramas with known orientation, by a factor of 3.3x for panoramas with unknown orientation, and by a factor of 6x for 180-degree FoV images with unknown orientation.

연구 동기 및 목표

  • 위치와 방향이 모두 알려지지 않은 상황에서 교차 뷰 지오로컬라이제이션의 과제를 해결한다.
  • 극도로 다른 시점 차이로 인해 발생하는 지면 영상와 공중 영상 간의 큰 도메인 갭을 줄인다.
  • 지면 영상의 제한된 시야각(FoV)과 알려지지 않은 방향으로 인한 국소화 모호성을 완화한다.
  • 교차 뷰 상관관계를 통한 공동 추정을 통해 위치와 방향을 동시에 추정함으로써 특징 매칭 정확도를 향상시킨다.
  • 사전에 방향 정보가 제공되지 않는 실세계 환경에서도 강력한 국소화를 가능하게 한다.

제안 방법

  • 공중 영상에 원형 좌표 변환을 적용하여 지면 뷰 기하학과 약간 일치시키고, 도메인 갭을 줄인다.
  • 지면 및 원형 변환된 공중 영상에서 깊이 특징을 추출하기 위해 이중 스트림 컨볼루션 신경망을 사용한다.
  • 자기 방향 축을 따라 교차 뷰 특징 간의 상관관계를 계산하여 방향을 추정하는 동적 유사도 매칭(DSM) 모듈을 구현한다.
  • 추정된 방향에 따라 공중 영상의 특징을 이동 및 자르기하여 특징 유사도와 국소화 정확도를 향상시킨다.
  • 상관관계 피크를 방향 추정치로 사용하고, 위치 매칭을 위해 특징 거리를 계산한다.
  • 기하학적 관계를 국소화에 핵심적으로 유지하기 위해 공간 인식 특징 볼륨을 활용한다.

실험 결과

연구 질문

  • RQ1방향이 알려지지 않은 상황에서 위치와 방향을 공동으로 추정하는 것이 교차 뷰 지오로컬라이제이션 성능을 향상시키는가?
  • RQ2원형 변환이 지면 및 공중 뷰 간의 도메인 갭을 줄이는 데 얼마나 효과적인가?
  • RQ3제한된 시야각 환경에서 방향 인식 특징 매칭이 모호성을 얼마나 줄이는가?
  • RQ4자기 방향 축을 따라 상관관계 기반 접근법이 지면 영상의 방향을 정확하게 추정할 수 있는가?
  • RQ5다양한 시야각과 방향 조건 하에서 최첨단 기술 대비 상위 1위 재현율 측면에서 제안된 방법은 어떻게 비교되는가?

주요 결과

  • 방향이 알려진 패ano라 이미지의 경우, CVUSA 데이터셋에서 상위 1위 위치 재현율이 1.5배 향상된다.
  • 방향이 알려지지 않은 패ano라 이미지의 경우, 최첨단 기술 대비 상위 1위 재현율이 3.3배 향상된다.
  • 방향이 알려지지 않은 180° 시야각 이미지의 경우, 상위 1위 재현율 향상 폭이 최대 6배에 이른다.
  • CVUSA 데이터셋에서 360° 시야각 이미지의 경우 방향 예측 정확도가 99.41%이며, 70° 시야각 이미지의 경우 61.67%이다.
  • 모든 시야각 설정에서 중앙값 방향 오차가 5° 이하로 유지되어 방향 추정의 높은 정밀도를 보여준다.
  • 정성적 결과는 작은 시야각 이미지의 경우에도 정확한 공동 국소화 및 방향 추정이 가능하며, 상관관계 피크가 참값과 잘 일치함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.