Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-View Image Matching for Geo-localization in Urban Environments

Yicong Tian, Chen Chen|arXiv (Cornell University)|2017. 03. 22.
Advanced Image and Video Retrieval Techniques인용 수 8
한 줄 요약

이 논문은 Faster R-CNN을 사용한 객체 검출과 Siamese 네트워크를 통한 특징 학습을 통해 스트리트 뷰 이미지와 배경 뷰 이미지 간의 건물 매칭을 통한 크로스 뷰 이미지 지오로컬라이제이션을 위한 딥러닝 프레임워크를 제안한다. 다수의 근접 이웃을 집계하기 위해 도미넌트 세트를 활용함으로써 정확도를 향상시켜 기준 방법을 능가하고, 새로 제안된 크로스 뷰 데이터셋에서 미리 보지 못한 도시로의 일반화 성능을 확보한다.

ABSTRACT

In this paper, we address the problem of cross-view image geo-localization. Specifically, we aim to estimate the GPS location of a query street view image by finding the matching images in a reference database of geo-tagged bird's eye view images, or vice versa. To this end, we present a new framework for cross-view image geo-localization by taking advantage of the tremendous success of deep convolutional neural networks (CNNs) in image classification and object detection. First, we employ the Faster R-CNN to detect buildings in the query and reference images. Next, for each building in the query image, we retrieve the $k$ nearest neighbors from the reference buildings using a Siamese network trained on both positive matching image pairs and negative pairs. To find the correct NN for each query building, we develop an efficient multiple nearest neighbors matching method based on dominant sets. We evaluate the proposed framework on a new dataset that consists of pairs of street view and bird's eye view images. Experimental results show that the proposed method achieves better geo-localization accuracy than other approaches and is able to generalize to images at unseen locations.

연구 동기 및 목표

  • 도시 환경에서 스트리트 뷰 이미지를 기반으로 배경 뷰 이미지 데이터베이스를 활용하거나 그 반대로 지오로컬라이제이션 문제를 해결하기 위해.
  • 시야각의 차이, 조명 변화, 계절 변화로 인한 시각적 및 기하학적 이질성 문제를 극복하기 위해.
  • 단일 근접 이웃 매칭을 초월하여 다수의 근접 이웃을 통한 전역 일致성 강제를 통해 지오로컬라이제이션 정확도를 향상시키기 위해.
  • 특징 공간에서 도미넌트 세트를 활용하여 다수의 근접 이웃 매칭을 효율적이고 강력하게 수행하는 방법을 개발하기 위해.
  • 학습 중에 볼 수 없었던 도시로의 일반화 성능 평가 및 학습된 표현의 이식 가능성 입증하기 위해.

제안 방법

  • 스트리트 뷰 및 배경 뷰 이미지의 건물을 Faster R-CNN을 사용해 검출하여 의미적 및 구조적 정렬을 수행한다.
  • 양의 건물 이미지 쪼 Reaper와 음의 이미지 쪼 Reaper를 기반으로 Siamese 컨볼루션 신경망을 훈련시켜 공유되는 구분력 있는 특징 공간을 학습한다.
  • 학습된 특징 공간에서 k-최근접 이웃 검색을 수행하여 각 쿼리 건물에 대한 후보 매칭을 찾는다.
  • 도미넌트 세트 기반 알고리즘을 적용하여 쿼리와 가장 잘 매칭되는 일관적이고 압축된 참조 건물 집합을 식별하고, 전역 일치성을 강제한다.
  • 도미넌트 세트에 포함된 건물들의 평균 GPS 좌표를 최종 지오로컬라이제이션 추정치로 계산한다.
  • 학습 및 평가를 위해 쌍으로 구성된 스트리트 뷰 및 배경 뷰 이미지의 대규모 크로스 뷰 데이터셋을 사용한다.

실험 결과

연구 질문

  • RQ1기존의 국소적 특징 매칭 방식에 비해 딥러닝 기반의 건물 검출 및 매칭이 크로스 뷰 지오로컬라이제이션 정확도 향상에 기여하는가?
  • RQ2단일 근접 이웃에 의존하는 것과 비교해 도미넌트 세트를 활용한 다수의 근접 이웃 매칭 방식이 지오로컬라이제이션의 견고성 향상에 얼마나 효과적인가?
  • RQ3학습 중에 볼 수 없었던 도시로의 일반화가 가능하여, 학습된 표현의 견고성이 입증되는가?
  • RQ4정확도 및 효율성 측면에서 도미넌트 세트 방식이 GMCP와 같은 대안적 다수 매칭 방법보다 얼마나 뛰어나게 성능을 내는가?
  • RQ5크로스 뷰 지오로컬라이제이션 작업에서 전체 이미지 매칭에 비해 건물 기반 매칭이 성능을 더 뛰어나게 하는가?

주요 결과

  • 제안된 방법은 볼 수 있는 도시뿐 아니라 볼 수 없는 도시에서도 SIFT 기반 기준 방법보다 유의미하게 높은 지오로컬라이제이션 정확도를 달성한다.
  • 전체 이미지 매칭 대비 건물 기반 매칭을 사용할 경우, 뷰포인트 변화가 높은 복잡한 도시 환경에서 성능 향상이 두드러진다.
  • 도미넌트 세트 기반 다수 근접 이웃 매칭 방식은 GMCP보다 정확도와 계산 효율성 측면에서 모두 뛰어나며, 특히 k와 NC가 증가할수록 성능 향상이 두드러진다.
  • 맨해튼과 같은 볼 수 없는 도시로의 일반화 성능이 뛰어나, 학습된 특징의 이식 가능성은 훈련 도메인을 초월함을 보여준다.
  • 새로운 크로스 뷰 데이터셋에서 다양한 오차 기준 이하에서 뛰어난 성능을 보이며, 특히 낮은 오차 기준에서 재현율 향상이 두드러진다.
  • 건물 특징의 의미론적 성격과 딥 러닝 기반 특징 학습 덕분에 뷰포인트 변화, 조명 변화, 계절 변화에 대해 강건함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.