[논문 리뷰] Few-View Object Reconstruction with Unknown Categories and Camera Poses
FORGE는 객체 카테고리나 카메라 자세에 대한 사전 지식 없이, 형태 복원과 상대 카메라 자세 추정을 동시에 최적화하여 소수의 시야에서 캘리브레이션되지 않은 이미지로부터 3D 객체 재구성할 수 있다. 3D 특징 학습, 시야 간 일관성 및 명시적 3D 상관관계를 활용하여 재구성 및 자세 추정에서 최신 기술 수준의 성능를 달성하며, 최소한의 지도 학습으로도 새로운 객체 카테고리로 효과적으로 일반화된다.
While object reconstruction has made great strides in recent years, current methods typically require densely captured images and/or known camera poses, and generalize poorly to novel object categories. To step toward object reconstruction in the wild, this work explores reconstructing general real-world objects from a few images without known camera poses or object categories. The crux of our work is solving two fundamental 3D vision problems -- shape reconstruction and pose estimation -- in a unified approach. Our approach captures the synergies of these two problems: reliable camera pose estimation gives rise to accurate shape reconstruction, and the accurate reconstruction, in turn, induces robust correspondence between different views and facilitates pose estimation. Our method FORGE predicts 3D features from each view and leverages them in conjunction with the input images to establish cross-view correspondence for estimating relative camera poses. The 3D features are then transformed by the estimated poses into a shared space and are fused into a neural radiance field. The reconstruction results are rendered by volume rendering techniques, enabling us to train the model without 3D shape ground-truth. Our experiments show that FORGE reliably reconstructs objects from five views. Our pose estimation method outperforms existing ones by a large margin. The reconstruction results under predicted poses are comparable to the ones using ground-truth poses. The performance on novel testing categories matches the results on categories seen during training. Project page: https://ut-austin-rpl.github.io/FORGE/
연구 동기 및 목표
- 객체 카테고리와 카메라 자세가 알려지지 않은 실세계 환경에서 소수의 시야에서 3D 객체 재구성 기능을 제공하는 것.
- 기존 방법이 필요로 하는 고밀도 이미지, 알려진 자세 또는 카테고리별 지도 학습의 한계를 극복하는 것.
- 3D 재구성과 상대 카메라 자세 추정을 동시에 향상시키는 통합 프레임워크를 개발하는 것.
- 학습 중에 볼 수 없었던 새로운 객체 카테고리로 효과적으로 일반화하는 것.
- 3D 형태의 진짜값을 사용하지 않고, 기울기 가능 볼륨 렌더링을 통한 이미지 재구성 손실만을 사용하여 학습하는 것.
제안 방법
- FORGE는 시야 간 일관성 손실을 통해 훈련된 박층 인코더를 사용하여 각 입력 이미지를 3D 바이트 특징으로 인코딩한다.
- 2D 이미지 특징과 3D 바이트 특징을 모두 활용하여 명시적 3D 시야 간 상관관계를 설정하는 글로벌 자세 특징 추출기를 통해 모든 입력 시야 간의 상대 카메라 자세를 추정한다.
- 모든 시야 간 공동 추론을 위해 자기주의 블록을 사용하여 쌍방향 추정에서 발생하는 오차 누적 문제를 줄인다.
- 예측된 상대 자세를 사용하여 3D 특징을 공유 재구성 공간으로 변환하고, 특징 집합을 통해 신경 렌더링 필드로 융합한다.
- 렌더링된 새로운 시야와 입력 이미지 간의 재구성 손실을 사용하여 엔드 투 엔드로 모델을 훈련시켜 3D 형태 지도 학습이 필요 없도록 한다.
- cascaded 훈련 전략은 먼저 진짜 자세를 사용하여 강력한 3D 특징 사전 지식을 학습한 후, 시야 일관성 있는 3D 특징 공간에서 자세 추정기 훈련을 수행한다.
실험 결과
연구 질문
- RQ1소수의 시야에서 3D 재구성 모델이 카테고리별 지도 학습이나 표준 공간 지도 학습 없이도 새로운 객체 카테고리로 일반화할 수 있는가?
- RQ2대규모 자세 변동이 있는 소수의 校정되지 않은 시야에서 상대 카메라 자세를 정확히 추정할 수 있는가?
- RQ33D 재구성과 자세 추정을 동시에 최적화하면 두 작업의 성능 향상 정도는 어느 정도인가?
- RQ43D 특징 공간에서의 시야 간 일관성 강제 조건이 큰 시야 변화 조건에서도 자세 추정의 견고성을 향상시키는가?
- RQ5소수의 시야 설정에서 상대 자세 추정에 대해 명시적 3D 상관관계 학습이 암묵적 또는 2D 기반 상관관계보다 우수한가?
주요 결과
- FORGE는 테스트 시간 최적화 후 자세 추정에서 30%의 성능 향상을 달성하여 이전 최고 성능 모델인 8-Point Transformer를 크게 능가한다.
- FORGE의 회전 및 이동 오차는 이전 최신 기술 수준의 방법보다 절반 이하이며, 볼 수 있었던 카테고리와 새로운 카테고리 간 일반화 갭은 오직 5도에 불과하다.
- 예측된 자세를 사용한 재구성 품질은 진짜 자세를 사용한 성능과 유사하여 자세 추정 오차에 대해 견고함을 입증한다.
- 모델은 새로운 객체 카테고리로 효과적으로 일반화되며, 볼 수 있었던 카테고리와 거의 동일한 성능을 달성하며 PSNR 및 SSIM에서 최소한의 감소를 보인다.
- 제거 실험 결과, 시야 간 일관성 손실 및 명시적 3D 상관관계가 신뢰할 수 있는 자세 추정에 필수적임을 확인하였으며, 이를 생략할 경우 성능 저하가 60% 감소한다.
- 평균 풀링과 순차적 특징 융합의 융합은 재구성 품질을 향상시키며, 인코더에서 3D U-Net의 부재는 카테고리 간 일반화 능력을 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.