[논문 리뷰] Large Scale Joint Semantic Re-Localisation and Scene Understanding via Globally Unique Instance Coordinate Regression
이 논문은 대규모 공동 세분화 재현역할 및 환경 이해를 위해 전역적으로 유일한 인스턴스 레이블과 각 객체당 국소 3D 좌표를 동시에 회귀하는 새로운 이단계 딥러닝 프레임워크를 제안한다. 객체 인스턴스 인식을 국소 좌표 예측과 분리함으로써, CamVid-360에서 22cm 중앙값 거리 오차와 0.71° 각도 오차를 기록하며 최신 기술 수준의 6-DoF 카메라 자세 추정을 달성한다. 이는 실제 및 합성 데이터셋, 대규모 및 근사 3D 지ap을 포함하여 이전 방법들을 모두 능가한다.
In this work we present a novel approach to joint semantic localisation and scene understanding. Our work is motivated by the need for localisation algorithms which not only predict 6-DoF camera pose but also simultaneously recognise surrounding objects and estimate 3D geometry. Such capabilities are crucial for computer vision guided systems which interact with the environment: autonomous driving, augmented reality and robotics. In particular, we propose a two step procedure. During the first step we train a convolutional neural network to jointly predict per-pixel globally unique instance labels and corresponding local coordinates for each instance of a static object (e.g. a building). During the second step we obtain scene coordinates by combining object center coordinates and local coordinates and use them to perform 6-DoF camera pose estimation. We evaluate our approach on real world (CamVid-360) and artificial (SceneCity) autonomous driving datasets. We obtain smaller mean distance and angular errors than state-of-the-art 6-DoF pose estimation algorithms based on direct pose regression and pose estimation from scene coordinates on all datasets. Our contributions include: (i) a novel formulation of scene coordinate regression as two separate tasks of object instance recognition and local coordinate regression and a demonstration that our proposed solution allows to predict accurate 3D geometry of static objects and estimate 6-DoF pose of camera on (ii) maps larger by several orders of magnitude than previously attempted by scene coordinate regression methods, as well as on (iii) lightweight, approximate 3D maps built from 3D primitives such as building-aligned cuboids.
연구 동기 및 목표
- 실세계 로봇 및 자율주행 분야에서 강인하고 확장 가능하며 검증 가능한 재현역할 시스템의 필요성을 충족하기 위해 의미 이해와 6-DoF 카메라 자세 추정을 통합한다.
- 큰 환경에서 직접 6-DoF 자세 회귀 및 환경 좌표 회귀의 한계를 극복하며, 특히 구조물 손실이나 도메인 이동과 같은 도전적인 조건에서도 유연성을 확보한다.
- 밀도 높은 3D 포인트 클라우드에 의존도를 줄이기 위해, 건물에 맞춰진 직육면체와 같은 3D 기하도구로 구성된 경량 근사 3D 지도를 사용한 정확한 카메라 재현역할을 가능하게 한다.
- 인스턴스 세그멘테이션과 국소 좌표 회귀로 분리된 작업으로 재구성함으로써, 학습 수렴 속도와 예측 정확도를 향상시킨다.
- 실세계(CamVid-360) 및 합성(SceneCity) 데이터셋, 그리고 다양한 카메라 간 재현역할(예: Google 스트리트 뷰)을 포함한 다양한 시나리오에 대한 일반화 능력을 입증한다.
제안 방법
- 각 픽셀에 대해 전역적으로 유일한 인스턴스 레이블과 해당 객체 중심 기준의 국소 3D 좌표를 예측하는 컨volution 신경망(CNN)을 훈련한다.
- 환경 좌표 회귀를 두 가지 별도 작업으로 분해한다: (1) 전역적으로 유일한 식별자를 가진 인스턴스 수준의 의미 세그멘테이션, (2) 각 인스턴스별 국소 좌표 회귀.
- 사전에 계산된 3D 지도에서의 예측된 객체 중심 좌표와 픽셀별 국소 좌표를 조합하여 전역 3D 환경 좌표를 재구성한다.
- 재구성된 3D 환경 좌표에서 PnP(Perspective-n-Point) 알고리즘을 사용해 6-DoF 카메라 자세를 추정한다.
- 훈련 및 평가를 위해 밀도 높은 영상 시퀀스에서 구조에서 유도된 영상(SfM)을 사용해 정밀한 3D 포인트 클라우드를 생성한다.
- L1, L2 및 표현 손실(L5-LRec-Lab)을 조합한 다중 작업 손실을 사용해 네트워크를 훈련하며, 설계 선택 사항을 검증하기 위해 아블레이션 연구를 실시한다.
실험 결과
연구 질문
- RQ1큰 환경에서 스케일링과 정확도를 향상시키기 위해 환경 좌표 회귀를 인스턴스 인식과 국소 좌표 예측으로 효과적으로 분해할 수 있는가?
- RQ2제안된 방법은 대규모 실세계(CamVid-360) 및 합성(SceneCity) 데이터셋에서 최신 기술 수준의 직접 자세 회귀 및 환경 좌표 기반 방법과 비교해 6-DoF 카메라 재현역할 성능이 어떻게 되는가?
- RQ3다른 카메라(예: Google 스트리트 뷰)나 건물가 없는 환경을 사용한 재현역할과 같은 도전적인 상황에 대해 어느 정도 일반화가 가능한가?
- RQ4직육면체와 같은 3D 기하도구로 구성된 경량 근사 3D 지도를 사용해도 정확한 6-DoF 자세 추정이 가능할 수 있는가? 이는 계산 비용을 줄이는 데 기여하는가?
- RQ5인스턴스 레이블과 국소 좌표 예측을 분리함으로써, 종단간 환경 좌표 회귀보다 수렴 속도가 빠르고 성능이 향상되는가?
주요 결과
- 제안된 방법은 CamVid-360 데이터셋에서 22cm 중앙값 거리 오차와 0.71° 중앙값 각도 오차를 기록하며, 직접 6-DoF 회귀 및 환경 좌표 추정 기반 최신 기술 수준의 방법들을 모두 능가한다.
- 더 큰 SceneCity Medium 데이터셋에서는 20cm 중앙값 거리 오차와 0.76° 중앙값 각도 오차를 기록하여 도시 규모 환경으로의 확장성을 입증한다.
- CamVid-360에서 지도값 위치와 50cm 이내에 위치한 픽셀 비율이 53% 이상이며, SceneCity Medium에서는 39%로, 높은 기하학적 정확도를 보여준다.
- L5-LRec-Lab 손실(인스턴스 레이블 및 국소 좌표 예측의 통합)은 대규모 지도에서 모든 베이스라인, 특히 PoseNet과 L3-Rec-Repr보다 17% 이상의 재현역할 정확도 향상을 기록한다.
- Google 스트리트 뷰 이미지 또는 건물가 없는 환경에서 테스트했을 때, 다른 방법들보다 더 강인한 성능을 보이며 도메인 이동 조건에서도 뛰어난 일반화 능력을 입증한다.
- 직육면체로 구성된 근사 3D 지도를 사용함으로써, Small SceneCity 데이터에서 L5-LRec-Lab를 초월하고, PoseNet 및 L3-3D-Repr를 뛰어넘는 성능을 기록하여 저비용, 확장 가능한 구현 가능성의 타당성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.