Skip to main content
QUICK REVIEW

[논문 리뷰] RenderNet: Visual Relocalization Using Virtual Viewpoints in Large-Scale Indoor Environments

Jiahui Zhang, Shitao Tang|arXiv (Cornell University)|2022. 07. 26.
Advanced Image and Video Retrieval Techniques인용 수 6
한 줄 요약

RenderNet는 실사 이미지 렌더링 대신 학습된 전역 및 국소 특징을 통해 가상의 시점(뷰포인트)을 생성하는 새로운 접근 방식을 제안한다. 이는 대규모 실내 환경에서의 시각적 재현위치 결정을 향상시킨다. 데이터베이스에 이러한 가상 시점을 추가하고, 이를 통해 자세를 보정함으로써 이미지 검색 및 특징 매칭 성능을 향상시키며, 엄격한 자세 기준(0.25m, 2°) 하에서 Inloc 데이터셋에서 각각 7.1% 및 12.2%의 정확도 향상을 달성한다.

ABSTRACT

Visual relocalization has been a widely discussed problem in 3D vision: given a pre-constructed 3D visual map, the 6 DoF (Degrees-of-Freedom) pose of a query image is estimated. Relocalization in large-scale indoor environments enables attractive applications such as augmented reality and robot navigation. However, appearance changes fast in such environments when the camera moves, which is challenging for the relocalization system. To address this problem, we propose a virtual view synthesis-based approach, RenderNet, to enrich the database and refine poses regarding this particular scenario. Instead of rendering real images which requires high-quality 3D models, we opt to directly render the needed global and local features of virtual viewpoints and apply them in the subsequent image retrieval and feature matching operations respectively. The proposed method can largely improve the performance in large-scale indoor environments, e.g., achieving an improvement of 7.1\% and 12.2\% on the Inloc dataset.

연구 동기 및 목표

  • 대규모 실내 환경에서 발생하는 광범위한 시점 및 외관 변화로 인한 시각적 재현위치 결정 성능 저하 문제를 해결하기 위해.
  • 실제 데이터베이스 이미지와 쿼리 이미지 간의 겹침이 낮은 재현위치 파이프라인에서 이미지 검색 및 2D-3D 대응 특징 매칭 성능을 향상시키기 위해.
  • 고비용이며 고정밀도인 3D 모델에 의존하는 것을 제거하기 위해, 가상 시점을 위한 전역 및 국소 특징만 직접 합성함으로써.
  • 두 단계의 운영 방식을 통해 재현위치 정확도를 향상시키기 위해: 가상 특징을 이용한 시점 증강 및 거친 추정 자세를 이용한 자세 보정.
  • 특징 기반의 가상 시점 생성이 이미지 기반 합성보다 강건성과 성능 면에서 뛰어나다는 것을 입증하기 위해.

제안 방법

  • RenderNet는 신경망을 사용하여 가상 시점에 대한 전역 특징을 직접 예측하며, 이는 이미지 검색에서 더 나은 매칭 데이터베이스 뷰를 찾는 데 사용된다.
  • 별도의 네트워크인 RenderNet_L은 가상 시점에 대한 정밀화된 국소 특징 서술자를 예측하여 2D-3D 특징 매칭 정확도를 향상시킨다.
  • 가상 시점을 사전에 샘플링하여 다양한 카메라 각도를 커버함으로써 검색 단계에서 시점 증강이 가능하도록 한다.
  • RANSAC 및 PnP를 통해 초도 자세 추정을 수행한 후, 거친 자세 추정치를 사용하여 새로운 가상 시점을 생성함으로써 개선된 대응 관계를 통한 자세 보정을 가능하게 한다.
  • 최종적으로 필요한 특징만 집중적으로 처리함으로써 이미지 합성을 피함으로써 잡음과 기계적 오류를 줄이고 강건성을 향상시킨다.
  • 장면 고유의 외관 변화에 적응하기 위해 타겟 데이터셋(Inloc)에서 모델을 미세조정함으로써 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1학습된 특징을 사용한 가상 시점 생성이 대규모 실내 재현위치 결정에서 이미지 검색 성능을 향상시키는가?
  • RQ2전역 및 국소 특징만 생성하는 것이 전체 이미지 합성보다 재현위치 정확도 및 강건성 측면에서 뛰어나게 되는가?
  • RQ3가상 특징을 이용한 시점 증강이 쿼리 이미지와 실제 데이터베이스 이미지 간 겹침이 낮은 상황에서 미치는 영향을 어느 정도 줄일 수 있는가?
  • RQ4거친 자세 추정치로부터 생성된 가상 시점을 이용한 자세 보정이 최종 위치 추정 정확도 향상에 얼마나 효과적인가?
  • RQ5타겟 데이터셋에서 RenderNet을 미세조정하면 실제 실내 환경에서 성능 향상이 유의미하게 이루어지는가?

주요 결과

  • RenderNet는 Inloc 데이터셋의 DUC1 시나리오에서 (0.25m, 2°) 기준으로 7.1%의 정확도 향상을, DUC2에서는 12.2%의 정확도 향상을 달성하여 뚜렷한 성능 향상을 입증한다.
  • 시점 증강 단계만으로도 DUC1에서는 각각 4.0%, 5.6%, 6.5%의 정확도 향상이 있었고, DUC2에서는 각각 16.0%, 15.3%, 12.2%의 향상이 있었으며, 이는 세 가지 기준에 대해 적용된 결과이다.
  • (0.25m, 2°) 기준으로 시점 증강 단계에 비해 자세 보정이 추가로 4.6%와 9.9%의 정확도 향상을 이끌어냈다.
  • 전체 RenderNet 파이프라인은 DUC1과 DUC2에서 각각 (5m, 10°) 기준으로 25.9%와 13.7%의 정확도 향상을 달성했다.
  • 국소 특징 보정 모듈(RenderNet_L)을 제거할 경우 (5m, 10°) 기준으로 성능이 8.1% 감소하여, 이는 큰 시점 변화를 다루는 데서의 효과성을 입증한다.
  • Inloc 데이터셋에서 RenderNet을 미세조정하면 (5m, 10°) 기준으로 각각 3.5%와 6.9%의 성능 향상이 있었으며, 이는 도메인 적응에 있어 그 가치를 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.