[논문 리뷰] PoseDiffusion: Solving Pose Estimation via Diffusion-aided Bundle Adjustment
PoseDiffusion는 2차원 대응 관계로부터 기하 구속 조건을 확률적 확산 과정에 통합하여 반복적으로 카메라 포즈를 개선하는 확산 기반 프레임워크를 제안한다. CO3Dv2와 RealEstate10k에서 최신 기술 수준의 정확도를 달성하며, 희박한 시야 및 도전적인 설정에서 전통적인 SfM 및 학습 기반 방법을 능가한다.
Camera pose estimation is a long-standing computer vision problem that to date often relies on classical methods, such as handcrafted keypoint matching, RANSAC and bundle adjustment. In this paper, we propose to formulate the Structure from Motion (SfM) problem inside a probabilistic diffusion framework, modelling the conditional distribution of camera poses given input images. This novel view of an old problem has several advantages. (i) The nature of the diffusion framework mirrors the iterative procedure of bundle adjustment. (ii) The formulation allows a seamless integration of geometric constraints from epipolar geometry. (iii) It excels in typically difficult scenarios such as sparse views with wide baselines. (iv) The method can predict intrinsics and extrinsics for an arbitrary amount of images. We demonstrate that our method PoseDiffusion significantly improves over the classic SfM pipelines and the learned approaches on two real-world datasets. Finally, it is observed that our method can generalize across datasets without further training. Project page: https://posediffusion.github.io/
연구 동기 및 목표
- 희박한 시야 및 넓은 기준선 설정에서 전통적인 구조-운동 복원(SfM) 파이프라인의 한계를 해결하기 위해.
- 에피포라 기하학에서 유래한 기하 구속 조건을 딥 러닝 프레임워크에 통합하여 포즈 추정 성능을 향상시키기 위해.
- 배럴 조정을 모방하는 가역적이고 반복적인 개선 과정을 개발하여 확산 모델의 인덕티브 바이어스를 활용하기 위해.
- 자유형 이미지 컬렉션에서 외부 및 내부 카메라 파rameter를 엔드 투 엔드로 예측할 수 있도록 하기 위해.
제안 방법
- 카메라 포즈 추정을 확산 모델을 사용하여 조건부 분포 p(x|I) 학습으로 설정하며, 여기서 x는 카메라 포즈이고 I는 입력 이미지 집합이다.
- 전방 확산 과정을 역행하여 노이즈가 있는 카메라 포즈 추정치를 반복적으로 개선하는 디노이징 U-Net 아키텍처를 사용한다.
- 샘플링 중에 에피포라 구속 조건을 강제로 이행하기 위해 2차원 이미지 간 대응 관계를 통한 기하 지도를 통합하여 기하 일관성을 향상시킨다.
- 다중 척도 특징 추출기(예: DINO ViT-S16)를 사용하여 확산 모델의 조건부 입력으로 사용되는 이미지 임베딩을 생성한다.
- 기하 구속 조건을 포함한 분류기 없는 지도를 사용하여 샘플링 과정을 더 일관되고 정확한 포즈 솔루션 쪽으로 유도한다.
- 지식이 있는 카메라 포즈를 가진 대규모 데이터셋에서 자기 지도 학습 방식으로 모델을 훈련시켜, 새로운 시나리오로의 일반화 능력을 확보한다.
실험 결과
연구 질문
- RQ1확산 기반 프레임워크가 카메라 포즈 추정에서 복잡하고 비凸인 최적화 과정인 배럴 조정의 특성을 효과적으로 모델링할 수 있는가?
- RQ22차원 대응 관계에서 유도된 기하 구속 조건을 통합할 경우, 확산 기반 포즈 추정의 정확도와 일관성이 어떻게 향상되는가?
- RQ3학습된 확산 모델이 미세조정 없이 데이터셋과 시나리오 유형 간에 일반화 가능한가, 특히 데이터가 적은 환경에서의 성능은 어떠한가?
- RQ4희박한 시야 및 밀도 높은 시야 설정 모두에서 이론적 SfM 파이프라인과 학습 기반 기준선을 능가하는가?
- RQ5대칭적이거나 무늬가 적은 환경에서 배경 컨텍스트가 포즈 추정 정확도에 얼마나 기여하는가?
주요 결과
- PoseDiffusion는 DINO ViT-S16 백본을 사용하여 CO3Dv2에서 66.5 mAA(30)의 성능을 기록하며, ResNet50 및 지도 학습된 ResNet50를 모두 능가한다.
- 100개의 프레임이 있는 설정에서 COLMAP+SPSG와 유사한 성능을 보였으며, COLMAP는 지도 정보에 액세스할 수 있었음에도 불구하고.
- 100개의 확산 단계(T=100)를 사용할 경우 최적의 성능을 기록했으며, 100단계를 초과해도 유의미한 향상이 없었다.
- 배경 픽셀을 마스킹하면 mAA(30)가 57.0으로 감소하여 배경 컨텍스트가 포즈 추정에 크게 기여함을 시사한다.
- 미세조정 없이 데이터셋 간에 일반화 가능하며, 강력한 제로샷 일반화 능력을 입증한다.
- PoseDiffusion는 NeRF 학습의 지도를 향상시켜 외부 및 내부 카메라 파rameter 추정에서 뛰어난 정확도를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.