[논문 리뷰] Instruct 3D-to-3D: Text Instruction Guided 3D-to-3D conversion
Instruct 3D-to-3D는 원본 3D 시점 조건을 부여한 사전 학습된 이미지-이미지 확산 모델을 활용하여 고해상도, 일관성 있고 제어 가능한 3D 생성을 위한 텍스트 지시어 기반 3D-to-3D 변환 방법을 제안한다. 원본 시점 조건화와 동적 스케일링을 통합하여 기준 모델 대비 뛰어난 품질과 3D 일관성을 달성한다.
We propose a high-quality 3D-to-3D conversion method, Instruct 3D-to-3D. Our method is designed for a novel task, which is to convert a given 3D scene to another scene according to text instructions. Instruct 3D-to-3D applies pretrained Image-to-Image diffusion models for 3D-to-3D conversion. This enables the likelihood maximization of each viewpoint image and high-quality 3D generation. In addition, our proposed method explicitly inputs the source 3D scene as a condition, which enhances 3D consistency and controllability of how much of the source 3D scene structure is reflected. We also propose dynamic scaling, which allows the intensity of the geometry transformation to be adjusted. We performed quantitative and qualitative evaluations and showed that our proposed method achieves higher quality 3D-to-3D conversions than baseline methods.
연구 동기 및 목표
- 자연어 지시어에 의해 유도되는 제어 가능하고 고품질의 3D-to-3D 편집이 부족한 문제를 해결하기 위해.
- 텍스트 지시어 기반 3D 시점 변환 과정에서 3D 일관성과 구조적 정밀도를 향상시키기 위해.
- 3D-to-3D 변환 중 기하학적 변화 강도를 사용자가 제어할 수 있도록 하기 위해.
- 텍스트와 원본 3D 기하학적 구조에 조건화된 사전 학습된 이미지-이미지 확산 모델을 활용하여 고해상도 3D 생성을 달성하기 위해.
- 텍스트 기반으로 표현적인 편집을 가능하게 하면서도 원본 시점의 의미적 및 구조적 내용을 유지할 수 있는 방법을 제공하기 위해.
제안 방법
- 이 방법은 렌더링된 2D 뷰의 가능도를 극대화하기 위해 사전 학습된 이미지-이미지 확산 모델을 사용하여 목표 3D 시점에서 유도된 뷰의 고해상도 품질을 보장한다.
- 원본 3D 시점은 생성 과정에서 구조적 및 의미적 일관성을 유지하기 위해 명시적인 조건 입력으로 사용된다.
- 동적 스케일링이 도입되어 복셀 격자 해상도를 점진적으로 조정함으로써 부드럽고 제어 가능한 기하학적 변형을 가능하게 한다.
- 3D 표현은 복셀 격자 기반의 암시적 모델에 기반하며, 기하학적 변화는 확산 과정에서 반복적인 노이즈 제거를 통해 적용된다.
- 확산 과정 중 분류기 없는 지시를 적용하여 텍스트 지시어가 출력에 미치는 영향을 제어한다.
- 노이즈 예측 손실을 최소화함으로써 NeRF 유사 3D 표현을 최적화하며, 복소화된 뷰와 목표 이미지 간의 일치도를 높인다.

실험 결과
연구 질문
- RQ1텍스트 지시어 기반 3D-to-3D 변환은 기존 방법 대비 더 높은 이미지 품질과 3D 일관성을 달성할 수 있는가?
- RQ23D-to-3D 편집 중 기하학적 변형 강도는 어떻게 제어할 수 있는가?
- RQ3원본 3D 시점에 조건화하면 구조적 정밀도를 향상시키고 생성된 시점의 분포 이탈을 줄일 수 있는가?
- RQ4동적 스케일링은 전통적인 점진적 스케일링 대비 변형 과정에서 3D 구조를 더 잘 보존하는가?
- RQ5복잡한 지시어에 대해 공간적 추론 한계가 텍스트 기반 3D 편집에 미치는 영향은 무엇인가?
주요 결과
- Instruct 3D-to-3D는 DreamFusion과 CLIP-NeRF보다 낮은 BRISQUE 점수(더 높은 이미지 품질)를 기록하여 뛰어난 시각적 품질을 입증한다.
- CLIP 점수는 DreamFusion 수준과 유사하여, CLIP 최적화를 위해 특별히 설계되지 않았음에도 강력한 텍스트-이미지 정렬을 보여준다.
- 사용자 선호도 연구 결과, Instruct 3D-to-3D는 72%의 경우에서 DreamFusion과 CLIP-NeRF보다 선호되며, 더 높은 정성적 품질을 의미한다.
- 동적 스케일링은 점진적 스케일링보다 3D 구조를 더 잘 보존한다. 점진적 스케일링은 급격한 복셀 감소로 인해 심각한 구조 손상을 유발한다.
- 더 큰 동적 스케일링 요소는 더 큰 구조적 변화를 유도하며, 이는 변형 강도의 제어 가능성 확인에 기여한다.
- 공간적 추론 작업(예: 의자 위에 물체를 놓기)에서 실패 사례가 발생하며, 이는 모델이 구조적 구성 요소를 잘못 변경함을 보여주며, 깊이 인식 기반 추론의 필요성을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.