Skip to main content
QUICK REVIEW

[논문 리뷰] Point-Cloud Completion with Pretrained Text-to-image Diffusion Models

Yoni Kasten, Ohad Rahamim|arXiv (Cornell University)|2023. 06. 18.
3D Shape Modeling and Analysis인용 수 5
한 줄 요약

이 논문은 사전 훈련된 텍스트-이미지 확산 모델을 활용하여 텍스트 설명과 부호 거리 함수(SDF) 제약 조건을 이용해 불완전한 3D 포인트 클라우드를 보완하는 테스트 시 최적화 방법인 SDS-Complete을 제안한다. 새로운 시야 렌더링을 입력 포인트 클라우드와 텍스트 프롬프트 양쪽에 일치하도록 SDS 손실을 통해 최적화함으로써, 분포 외(OOD) 객체에서 최신 기술 수준(SOTA) 성능을 달성하며, 이전 방법 대비 평균으로 50% 낮은 Chamfer 손실을 기록한다.

ABSTRACT

Point-cloud data collected in real-world applications are often incomplete. Data is typically missing due to objects being observed from partial viewpoints, which only capture a specific perspective or angle. Additionally, data can be incomplete due to occlusion and low-resolution sampling. Existing completion approaches rely on datasets of predefined objects to guide the completion of noisy and incomplete, point clouds. However, these approaches perform poorly when tested on Out-Of-Distribution (OOD) objects, that are poorly represented in the training dataset. Here we leverage recent advances in text-guided image generation, which lead to major breakthroughs in text-guided shape generation. We describe an approach called SDS-Complete that uses a pre-trained text-to-image diffusion model and leverages the text semantics of a given incomplete point cloud of an object, to obtain a complete surface representation. SDS-Complete can complete a variety of objects using test-time optimization without expensive collection of 3D information. We evaluate SDS Complete on incomplete scanned objects, captured by real-world depth sensors and LiDAR scanners. We find that it effectively reconstructs objects that are absent from common datasets, reducing Chamfer loss by 50% on average compared with current methods. Project page: https://sds-complete.github.io/

연구 동기 및 목표

  • 학습 데이터에 잘 표현되지 않은 분포 외(OOD) 객체를 다루는 데에 한계를 가진 기존 포인트 클라우드 보완 방법의 문제를 해결하기 위해.
  • 대규모 3D 데이터셋을 수집하지 않고도 사전 훈련된 2D 확산 모델을 활용해 고품질의 3D 형상 보완을 가능하게 하기 위해.
  • 부분 포인트 클라우드로부터의 기하 제약 조건과 텍스트-이미지 확산 모델의 의미론적 사전 지식을 융합하여 정확한 표면 재구성 가능하게 하기 위해.
  • 깊이 카메라 및 LiDAR와 같은 다양한 실세계 센서에 모두 적용 가능한 통합 프레임워크 개발하기 위해.
  • 테스트 시 최적화를 통해 SDS 손실과 SDF 표현을 활용하면 예측 불가능한 객체 유형에 대해 일관되고 현실적인 보완이 가능하다는 것을 입증하기 위해.

제안 방법

  • 사전 훈련된 텍스트-이미지 확산 모델을 활용해 3D 형상 보완을 위한 이미지 사전 지식을 생성한다.
  • 모델을 미세조정하거나 대규모 3D 데이터셋이 필요 없이, 테스트 시 최적화 문제로 보완을 공식화한다.
  • 입력 포인트 클라우드를 통과하는 0레벨 집합을 보장함으로써 기하학적 정확성을 확보하기 위해 부호 거리 함수(SDF) 표면 표현을 사용한다.
  • 새로운 시야에서 렌더링된 이미지에 대해 SDS 손실을 적용하여, 텍스트 프롬프트와 확산 모델의 사전 지식에 일치하도록 한다.
  • 완성된 형상과 관측된 부분 기하학적 구조 간의 일관성을 향상시키기 위해 커리큘럼 기반의 카메라 샘플링 전략을 도입한다.
  • 최적화 과정에서 SDF를 반복적으로 갱신하여 SDS 손실을 최소화하면서도 포인트 클라우드 제약 조건을 만족시킨다.

실험 결과

연구 질문

  • RQ1사전 훈련된 텍스트-이미지 확산 모델을 미세조정 없이 3D 포인트 클라우드 보완에 효과적으로 활용할 수 있는가?
  • RQ22D 확산 모델의 의미론적 사전 지식을 부분 포인트 클라우드로부터의 3D 기하 제약 조건과 어떻게 융합할 수 있는가?
  • RQ3SDS 손실과 SDF 표현을 활용한 테스트 시 최적화가 분포 외(OOD) 객체에서 기존 방법보다 뛰어난 성능을 내는가?
  • RQ4카메라 샘플링 전략의 선택이 완성된 3D 형상의 일관성과 품질에 어떤 영향을 미치는가?
  • RQ5깊이 카메라 및 LiDAR와 같은 다양한 센서에서의 실세계 스캔에 대해 재학습 없이도 일반화 가능한가?

주요 결과

  • SDS-Complete는 기존 최신 기술 수준(SOTA) 방법 대비 분포 외(OOD) 객체에서 평균 Chamfer 손실을 50% 감소시켜 뛰어난 일반화 성능을 입증한다.
  • Redwood 데이터셋에서 SDS-Complete는 평균 Chamfer 손실 30.5를 기록하여, OOD 객체에서 PoinTr(59.0)와 ShapeFormer(59.0)를 크게 앞서며 뛰어난 성능을 보였다.
  • 내분포 객체에 대해서도 SOTA 방법과 유사한 성능를 달성하여 익숙한 카테고리에서는 성능 저하가 없음을 시사한다.
  • 제거 실험 결과, SDS 손실을 제거할 경우 형태 이해가 떨어지며(예: 의자에서 다리나 등받이가 누락됨), 이는 SDS 손실의 핵심적 역할을 입증한다.
  • SDF 표현은 포인트 클라우드 제약 조건을 강제로 만족시키는 데 필수적이며, 밀도 함수와 같은 대체 방법은 성능 저하를 초래한다.
  • 커리큘럼 기반 카메라 샘플링 전략은 무작위 샘플링 대비 완성 품질을 향상시키며, 관측된 기하학적 구조와의 일관성을 보다 잘 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.