[논문 리뷰] Metric3D: Towards Zero-shot Metric 3D Prediction from A Single Image
Metric3D는 다양한 카메라 모델 간의 척도 모호성을 해결하는 표준화된 카메라 공간 변환 모듈을 제안하여 단일 이미지에서 zero-shot 메트릭 3D 재구성 가능하게 한다. 800만 장의 이미지와 수천 가지의 카메라 유형으로 훈련함으로써 7개의 zero-shot 벤치마크에서 최신 기술 수준을 달성했으며, 2위를 차지한 단일 카메라 깊이 추정 챌린지에서 우수한 성능을 보였으며, 스케일 드리프트 없이 실제 환경 이미지에서 정확한 메트릭 깊이 복원을 가능하게 한다.
Reconstructing accurate 3D scenes from images is a long-standing vision task. Due to the ill-posedness of the single-image reconstruction problem, most well-established methods are built upon multi-view geometry. State-of-the-art (SOTA) monocular metric depth estimation methods can only handle a single camera model and are unable to perform mixed-data training due to the metric ambiguity. Meanwhile, SOTA monocular methods trained on large mixed datasets achieve zero-shot generalization by learning affine-invariant depths, which cannot recover real-world metrics. In this work, we show that the key to a zero-shot single-view metric depth model lies in the combination of large-scale data training and resolving the metric ambiguity from various camera models. We propose a canonical camera space transformation module, which explicitly addresses the ambiguity problems and can be effortlessly plugged into existing monocular models. Equipped with our module, monocular models can be stably trained with over 8 million images with thousands of camera models, resulting in zero-shot generalization to in-the-wild images with unseen camera settings. Experiments demonstrate SOTA performance of our method on 7 zero-shot benchmarks. Notably, our method won the championship in the 2nd Monocular Depth Estimation Challenge. Our method enables the accurate recovery of metric 3D structures on randomly collected internet images, paving the way for plausible single-image metrology. The potential benefits extend to downstream tasks, which can be significantly improved by simply plugging in our model. For example, our model relieves the scale drift issues of monocular-SLAM (Fig. 1), leading to high-quality metric scale dense mapping. The code is available at https://github.com/YvanYin/Metric3D.
연구 동기 및 목표
- 다양하고 예측 불가능한 카메라 모델에 대해 테스트 시 파라미터 조정 없이도 단일 이미지에서 zero-shot 메트릭 3D 재구성을 가능하게 하는 것.
- 단일 카메라 깊이 추정에서 다양한 초점 거리, 센서 크기, 픽셀 크기로 인한 메트릭 모호성을 해결하는 것.
- 다양한 카메라 유형과 장면 카테고리가 포함된 대규모 이질적 데이터셋에서 단일 모델을 훈련시키는 것.
- 테스트 데이터에 대한 스케일 정렬이나 미세조정 없이도 정확한 메트릭 깊이 예측을 달성하는 것.
- 메트릭 깊이 감독을 통해 단일 카메라 SLAM과 같은 후속 응용 프로그램에서 스케일 드리프트를 제거하는 것.
제안 방법
- 모든 훈련 이미지를 표준화된 카메라 모델로 매핑하는 표준화된 카메라 공간 변환 모듈을 도입하여 다양한 카메라 내부 파rameter의 변동성을 줄인다.
- 이 변환의 두 가지 변형을 적용: 하나는 이미지 외관을 표준화된 카메라 행동을 시뮬레이션하도록 조정하고, 다른 하나는 지도 레이블의 변환을 통해 감독을 제공한다.
- 추론 단계에서 복원된 카메라 변환을 사용하여 표준화된 공간 예측에서 실제 세계의 메트릭 깊이를 복원한다.
- 무작위 영역 정규화 손실을 제안하여 무작위로 잘린 이미지 패치에 스케일-이동 불변 손실을 적용함으로써 국소 기하학성과 분포에 중점을 둔다.
- 11개의 다양한 데이터셋에서 온 800만 장의 이미지로 모델을 훈련시켰으며, 실내, 실외, 자율 주행 장면을 포함한 수만 가지의 고유한 카메라 모델이 포함되어 있다.
- 기존의 단일 카메라 깊이 아키텍처에 구조적 수정 없이 모듈을 통합하여 광범위한 호환성을 확보한다.
실험 결과
연구 질문
- RQ1단일 단일 카메라 깊이 모델이 파라미터 조정 없이도 예측 불가능한 카메라 모델과 실제 세계의 메트릭 깊이 복원에 일반화될 수 있는가?
- RQ2다양한 초점 거리와 센서 크기로 인한 메트릭 모호성을 훈련 단계에서 어떻게 해결할 수 있는가? 이를 통해 zero-shot 메트릭 깊이 추정이 가능해지는가?
- RQ3대규모 이질적 데이터셋이 단일 카메라 깊이 추정에서 zero-shot 일반화에 얼마나 기여하는가?
- RQ4제안된 표준화된 카메라 공간 변환 모듈이 네트워크 내부 또는 외부에서 카메라 모델을 암시적 또는 명시적으로 인코딩하는 방법보다 우수한 성능을 낼 수 있는가?
- RQ5메트릭 깊이 예측이 스케일 드리프트를 제거함으로써 단일 카메라 SLAM과 같은 후속 작업을 크게 향상시킬 수 있는가?
주요 결과
- Metric3D는 스케일 정렬 없이도 NYU, KITTI, DIODE, ETH3D, iBims-1, NuScenes, 7Scenes를 포함한 7개의 zero-shot 벤치마크에서 최신 기술 수준을 달성했다.
- 이 방법은 2위 단일 카메라 깊이 추정 챌린지에서 우수한 성능을 보이며, 예측 불가능한 카메라 설정에서 뛰어난 일반화 능력과 메트릭 정확도를 입증했다.
- KITTI 오도메트리 벤치마크에서 Droid-SLAM에 Metric3D를 통합함으로써 스케일 드리프트가 완전히 제거되었고, 미세조정 없이도 고품질의 메트릭 밀도 매핑이 가능했다.
- 단지 메타데이터(초점 거리 및 픽셀 크기)만을 사용하여 Flickr 이미지에서 메트릭 3D 포인트 클라우드를 성공적으로 재구성했으며, 측정된 구조 크기가 합리적인 실제 세계 범위 내에 있었다.
- 시각적 비교에서 Adabins, NewCRFs, Omnidata와 같은 최신 기술 대비 훨씬 적은 아티팩트와 더 정확한 깊이 예측을 보였다.
- 다양한 초점 거리를 가진 6링 카메라 시스템에서도 일관된 360° 메트릭 재구성을 가능하게 하여 다중 시야 자율 주행 시나리오에서의 강건성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.