Skip to main content
QUICK REVIEW

[논문 리뷰] Dense Semantic 3D Map Based Long-Term Visual Localization with Hybrid Features

Tianxin Shi, Hainan Cui|arXiv (Cornell University)|2020. 05. 21.
Robotics and Sensor-Based Localization참고 문헌 52인용 수 5
한 줄 요약

이 논문은 장기적인 외관 변화 상황에서의 정확도를 향상시키기 위해 밀도 높은 의미적 3D 지도와 수작업으로 만든(SIFT) 및 학습된(R2D2) 특징을 융합한 하이브리드 시각적 로컬라이제이션 방법을 제안한다. 밀도 높은 의미적 3D 모델에서 유도된 의미 일致성 점수를 가중치가 부여된 RANSAC 기반 PnP 솔버에 소프트 제약 조건으로 활용하여, Aachen Day-Night 및 RobotCar Seasons 벤치마크에서 최신 기술 수준의 성능을 달성하였으며, 낮과 밤, 계절 변화와 같은 도전적인 조건에서도 이전 방법들을 능가한다.

ABSTRACT

Visual localization plays an important role in many applications. However, due to the large appearance variations such as season and illumination changes, as well as weather and day-night variations, it's still a big challenge for robust long-term visual localization algorithms. In this paper, we present a novel visual localization method using hybrid handcrafted and learned features with dense semantic 3D map. Hybrid features help us to make full use of their strengths in different imaging conditions, and the dense semantic map provide us reliable and complete geometric and semantic information for constructing sufficient 2D-3D matching pairs with semantic consistency scores. In our pipeline, we retrieve and score each candidate database image through the semantic consistency between the dense model and the query image. Then the semantic consistency score is used as a soft constraint in the weighted RANSAC-based PnP pose solver. Experimental results on long-term visual localization benchmarks demonstrate the effectiveness of our method compared with state-of-the-arts.

연구 동기 및 목표

  • 낮과 밤, 계절 변화 및 기상 변화와 같은 큰 외관 변화 상황에서의 시각적 로컬라이제이션 과제를 해결한다.
  • 외관 변화에 따라 성능이 저하되는 희소 3D 모델과 전통적인 특징 기술자(예: SIFT)의 한계를 극복한다.
  • 기하학적 매칭 파이프라인에 고수준의 의미 정보를 통합하여 로컬라이제이션의 강건성을 향상시킨다.
  • 수작업 특징과 학습된 특징을 효과적으로 융합하는 통합 프레임워크를 개발한다.
  • 의미 일치성 점수를 소프트 제약 조건으로 활용하여 후보 이미지 검색 및 자세 추정 정확도를 향상시킨다.

제안 방법

  • 희소 SfM 모델을 대체하기 위해 표준 다중 시점 스테레오(MVS) 방법을 사용하여 밀도 높은 의미적 3D 지도를 구축한다.
  • SIFT(수작업) 및 R2D2(학습) 특징을 모두 사용하여 다양한 촬영 조건에서도 강건한 특징 매칭을 가능하게 한다.
  • 하이브리드 특징을 사용해 이미지 검색을 수행하고, 3D-2D 의미적 대응 기반으로 쿼리 이미지와 데이터베이스 이미지 간의 의미 일치성 점수를 계산한다.
  • 의미 일치성 점수를 가중치가 부여된 RANSAC 기반 PnP 자세 추정 솔버에 소프트 제약 조건으로 적용하여 카메라 자세 추정을 정밀하게 보정한다.
  • 희소 모델 대비 더 높은 분류 능력을 갖춘 밀도 높은 3D 점들을 의미 지도에 활용하여 의미 일치성 점수의 정밀도를 향상시킨다.
  • 개별 객체 또는 의미적 세그멘테이션을 통해 의미 레이블을 3D 지도에 통합하여 의미 인식 기반 매칭을 가능하게 한다.

실험 결과

연구 질문

  • RQ1수작업 특징과 학습된 특징을 융합하면 큰 외관 변화 상황에서의 시각적 로컬라이제이션 강건성 향상에 기여하는가?
  • RQ2희소 모델 대비 밀도 높은 의미적 3D 지도가 의미 일치성 점수의 분류 능력을 어떻게 향상시키는가?
  • RQ3의미 일치성 점수를 소프트 제약 조건으로 통합할 경우 장기적 로컬라이제이션에서 자세 추정 정확도는 얼마나 향상되는가?
  • RQ4낮과 밤, 계절 변화와 같은 극한의 외관 변화가 발생하는 벤치마크에서 제안된 방법이 최신 기술 수준의 방법들을 능가하는가?
  • RQ5쿼리 이미지가 데이터베이스 이미지와 반대 방향에서 촬영된 경우, 방법의 성능은 어떻게 되는가?

주요 결과

  • Aachen Day-Night 데이터셋에서 제안된 방법은 0.25m/0.50m/5.0m 임계값에서 각각 89.3% / 95.4% / 97.6%의 정확도와 2°/5°/10° 임계값에서 각각 44.9% / 67.3% / 87.8%의 정확도를 기록하였으며, 한 가지 굵은 정밀도 지표를 제외한 모든 베이스라인을 능가하였다.
  • 제거 실험 결과, 의미 일치성 점수를 제거할 경우 일광 조건에서는 mAP가 8.8% 향상되고 야간 조건에서는 2.0% 향상되어 의미 점수의 효과를 입증하였다.
  • RobotCar Seasons 데이터셋에서 0.25m/0.50m/5.0m 임계값에서 각각 54.6% / 81.9% / 96.9%의 정확도와 2°/5°/10° 임계값에서 각각 14.8% / 33.0% / 51.3%의 정확도를 기록하였으며, 반대 방향 쿼리로 인한 도전에도 불구하고 제출 시점 기준으로 1위를 기록하였다.
  • SIFT는 일광 조건에서 최고의 성능을 보였고, R2D2는 야간 조건에서 뛰어난 성능을 보여, 하이브리드 특징의 상호 보완적 강점을 확인하였다.
  • 수작업 특징(SIFT)과 학습된 특징(R2D2)을 모두 사용한 하이브리드 특징 접근 방식이 단일 특징 유형을 사용하는 것보다 모든 조건에서 뛰어난 성능을 달성하였다.
  • 밀도 높은 의미적 3D 지도가 희소 모델 대비 더 신뢰성 있고 분류 능력이 뛰어난 의미 일치성 점수를 제공하여 검색 정확도 향상과 자세 추정의 강건성 향상에 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.