[논문 리뷰] OmniObject3D: Large-Vocabulary 3D Object Dataset for Realistic Perception, Reconstruction and Generation
OmniObject3D는 190종의 일상 카테고리에 걸쳐 총 6,000개의 물체를 포함하는 대규모 고해상도 실물 스캔 3D 데이터셋을 제공한다. 텍스처가 구현된 메쉬, 포인트 클라우드, 다중 시점 이미지, 영상 등 풍부한 애너테이션을 포함하며, 3D 인식, 새로운 시점 합성, 신경 표면 재구성, 3D 생성 분야의 고도화된 연구를 가능하게 한다. 실제 기하학적 형태와 외관을 반영함으로써 현실적인 3D 비전 분야에 새로운 도전 과제와 기회를 드러낸다.
Recent advances in modeling 3D objects mostly rely on synthetic datasets due to the lack of large-scale realscanned 3D databases. To facilitate the development of 3D perception, reconstruction, and generation in the real world, we propose OmniObject3D, a large vocabulary 3D object dataset with massive high-quality real-scanned 3D objects. OmniObject3D has several appealing properties: 1) Large Vocabulary: It comprises 6,000 scanned objects in 190 daily categories, sharing common classes with popular 2D datasets (e.g., ImageNet and LVIS), benefiting the pursuit of generalizable 3D representations. 2) Rich Annotations: Each 3D object is captured with both 2D and 3D sensors, providing textured meshes, point clouds, multiview rendered images, and multiple real-captured videos. 3) Realistic Scans: The professional scanners support highquality object scans with precise shapes and realistic appearances. With the vast exploration space offered by OmniObject3D, we carefully set up four evaluation tracks: a) robust 3D perception, b) novel-view synthesis, c) neural surface reconstruction, and d) 3D object generation. Extensive studies are performed on these four benchmarks, revealing new observations, challenges, and opportunities for future research in realistic 3D vision.
연구 동기 및 목표
- 3D 비전 모델을 훈련하고 평가하기 위한 대규모 고품질 실세계 3D 데이터셋의 부족 문제를 해결하기 위해.
- 합성 데이터와 실세계 데이터 간의 도메인 갭을 해소하기 위해 현실적이고 다양한 고해상도 데이터셋을 제공하기 위해.
- ImageNet과 LVIS와 같은 일반적인 2D 데이터셋 카테고리와의 일치를 통해 일반화 가능한 3D 표현 학습을 지원하기 위해.
- 3D 인식, 새로운 시점 합성, 신경 표면 재구성, 3D 생성 분야에 대한 종합적인 벤치마크를 구축하기 위해.
- 네 가지 핵심 연구 트랙에 걸쳐 광범위한 평가를 통해 현실적인 3D 비전 분야에서 새로운 도전 과제와 기회를 드러내기 위해.
제안 방법
- 고품질의 3D 및 2D 스캐너를 사용하여 고해상도 텍스처 메쉬와 정밀한 포인트 클라우드를 촬영한다.
- 각 물체는 다중 시점 RGB 이미지, 전경 마스크가 포함된 실물 촬영 영상, COLMAP 기반 카메라 포즈를 포함한다.
- 고정밀 스캐닝 파이프라인을 통해 텍스처 메쉬와 포인트 클라우드를 생성하여 기하학적 정확도와 현실적인 텍스처 디테일을 확보한다.
- 일致한 평가를 위해 Blender를 사용하여 동일한 카메라 설정으로 다중 시점 이미지를 렲출한다.
- 네 가지 평가 트랙을 설정한다: 강건한 3D 인식, 새로운 시점 합성, 신경 표면 재구성, 3D 물체 생성.
- Chamfer Distance 및 FID와 같은 정량적 지표를 사용하여 NeuS, MonoSDF, GET3D와 같은 표준 베이스라인 모델을 훈련 및 평가한다.
실험 결과
연구 질문
- RQ1실물 스캔된 3D 데이터의 현실성과 다양성이 분포 이동 및 오염 조건 하에서 3D 인식의 강건성에 어떤 영향을 미치는가?
- RQ2다중 시점 이미지와 고품질 메쉬는 새로운 시점 합성 및 신경 표면 재구성에 얼마나 기여하는가?
- RQ3현실 세계 스캔에서 희소한 시점으로 훈련된 현재의 신경 표면 재구성 방법의 한계는 무엇인가?
- RQ4대용량 어휘 데이터셋의 의미적 및 시각적 다양성은 3D 물체 생성 및 디센트링에 어떤 영향을 미치는가?
- RQ5복잡한 기하학적 형태와 텍스처를 가진 실세계 3D 물체로 일반화되는 3D 생성 모델의 핵심 과제는 무엇인가?
주요 결과
- 8개 시점의 희소 시점 재구성 설정에서 NeuS는 Chamfer Distance 7.96을 기록했으며, 이는 100개 시점 기준선(6.09)에 비해 유의미하게 열 劣한 성능을 보여, 희소 지도 학습에 대한 지속적인 과제를 시사한다.
- MonoSDF는 5개 시점에서 8개 시점으로 증가시킬 경우 성능 향상에 한계를 보이며, 깊이 안내 품질의 제약을 시사한다.
- 비용 볼륨 초기화에 있어 30개의 가장 가까운 원천 시점 범위가 최적임을 발견했으며, 이는 특징 일致성과 맥락적 풍부함 사이의 균형을 이루기 때문이다.
- 그룹 수준의 클러스터링 분석 결과, 높은 내부 유사성 그룹(예: 과일 및 채소)이 생성 분포를 지배하는 반면, 높은 분산 그룹(예: 땅콩, 핸드백, 버섯)은 학습을 방해함을 확인했다.
- 디센트링된 보간 분석 결과, 기하학적 형태와 텍스처 잠재변수 간의 완전한 분리가 이루어지지 않았으며, 특히 책 표지와 같은 복잡한 텍스처에서는 기하학적 형태 변화가 텍스처에 영향을 미침을 확인했다.
- 책 표지와 같은 복잡한 텍스처는 일관되게 낮은 품질로 생성되었으며, 향후 3D 생성 모델의 핵심 과제임을 재확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.