[논문 리뷰] Coin3D: Controllable and Interactive 3D Assets Generation with Proxy-Guided Conditioning
Coin3D는 기본 기하 도형으로 구성된 간단한 3D 형상 프록시를 다중 시점 확산 모델의 조건부 가이던스로 사용하여 제어 가능하고 상호작용 가능한 3D 자산 생성 프레임워크를 소개한다. 3D 어댑터, 프록시 기반 편집, 점진적 볼륨 캐싱, 볼륨-SDS 손실을 통합함으로써, 10초 미만의 반응 속도를 갖는 3D 미리보기와 세밀한 국소 편집을 가능하게 하여 기존의 3D 생성 방법에 비해 제어성과 상호작용성을 크게 향상시킨다.
As humans, we aspire to create media content that is both freely willed and readily controlled. Thanks to the prominent development of generative techniques, we now can easily utilize 2D diffusion methods to synthesize images controlled by raw sketch or designated human poses, and even progressively edit/regenerate local regions with masked inpainting. However, similar workflows in 3D modeling tasks are still unavailable due to the lack of controllability and efficiency in 3D generation. In this paper, we present a novel controllable and interactive 3D assets modeling framework, named Coin3D. Coin3D allows users to control the 3D generation using a coarse geometry proxy assembled from basic shapes, and introduces an interactive generation workflow to support seamless local part editing while delivering responsive 3D object previewing within a few seconds. To this end, we develop several techniques, including the 3D adapter that applies volumetric coarse shape control to the diffusion model, proxy-bounded editing strategy for precise part editing, progressive volume cache to support responsive preview, and volume-SDS to ensure consistent mesh reconstruction. Extensive experiments of interactive generation and editing on diverse shape proxies demonstrate that our method achieves superior controllability and flexibility in the 3D assets generation task.
연구 동기 및 목표
- 현재 3D 생성 모델 워크플로우에서의 제어성과 반응성 부족 문제를 해결하기 위해.
- 사용자가 텍스트나 이미지가 아닌 직관적인 간단한 형상 프록시를 사용해 3D 자산을 생성하고 편집할 수 있도록 하기 위해.
- 최소한의 지연 시간으로 실시간, 상호작용 가능한 3D 미리보기 및 국소 파트 편집을 지원하기 위해.
- 사용자가 정의한 기하학적 구조를 유지하면서도 고해상도 메시 재구성 품질을 확보하기 위해.
제안 방법
- 3D 어댑터를 도입하여 볼륨 기반의 간단한 형상 제어를 직접 3D 확산 모델에 적용함으로써 3D 인식 조건부 조건을 구현한다.
- 마스크 확장 전략을 활용한 프록시 기반 편집을 구현하여 수정되지 않은 영역를 유지하면서 자연스럽고 끊어지지 않는 국소 편집을 보장한다.
- 점진적 볼륨 캐싱을 통해 편집 간 중간 특징 볼륨을 재사용함으로써 미리보기 렲영 속도를 가속화하고, 10초 이내의 반응 시간을 달성한다.
- 볼륨-SDS(스코어 딜루션 샘플링) 손실을 통해 3D 기하학적 구조를 프록시 형상과 다중 시점 감시 정보에 맞추어 일관성 있는 메시 재구성 강화한다.
- 다중 시점 확산 사전 지식과 3D 프록시 가이던스를 통합하여 사용자가 프롬프트와 형상을 반복적으로 개선할 수 있도록 한다.
- 실시간으로 특징 볼륨을 구성하는 새로운 파이프라인을 도입하여 임의의 시점에서 빠른 생성과 미리보기를 가능하게 한다.

실험 결과
연구 질문
- RQ1기본 기하 도형으로 구성된 간단한 3D 형상 프록시가 확산 기반 프레임워크에서 고해상도 3D 생성을 효과적으로 이끌 수 있는가?
- RQ2최소한의 지연 시간과 높은 기하학적·시각적 일관성으로 3D 인식 국소 편집을 어떻게 달성할 수 있는가?
- RQ3상호작용 모델링 도중 몇 초 내로 반응성 있는 3D 미리보기를 어떻게 실현할 수 있는가?
- RQ4이미지나 텍스트 전용 조건부 조건에 비해 프록시 기반 조건부 조건이 재구성 정확도를 어떻게 향상시키는가?
- RQ5볼륨-SDS와 프록시 기반 편집이 생성된 3D 자산의 품질과 일관성에 얼마나 기여하는가?
주요 결과
- Coin3D는 편집당 5~10초 내로 상호작용 가능한 3D 미리보기를 구현하여, 기존 방법이 재구성에 수십 분이 소요되는 것에 비해 크게 빠르게 한다.
- 볼륨-SDS 손실은 아티팩트(예: 떠 있는 물체)를 감소시키고 안정적인 의자 바닥과 같은 더 자연스러운 기하학적 구조를 생성함으로써 메시 재구성 품질을 향상시킨다.
- 마스크 확장 전략을 활용한 프록시 기반 편집은 끊어지지 않고 자연스러운 편집을 가능하게 하며, 이 중 하나를 제거하면 끊어진 팔다리나 융합된 형태 등의 기하학적 결함이 발생한다.
- 국소 편집 동안 변경되지 않은 부분을 유지함으로써, 여러 번의 편집 단계를 거쳐도 강력한 콘텐츠 보존 성능을 보여준다.
- 사용자 연구 및 정성적 결과를 통해 이 프레임워크는 이미지 인painting과 유사한 직관적이고 반복적인 디자인 워크플로우를 3D 공간에서 지원함을 확인했다.
- Latent-NeRF와 Fantasia3D와 같은 베이스라인 방법에 비해 생성 정확도와 상호작용성 측면에서 모두 뛰어나며, 특히 반응성 있는 미리보기와 형상 제어에서 두각을 나타낸다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.