[논문 리뷰] MATLABER: Material-Aware Text-to-3D via LAtent BRDF auto-EncodeR
MATLABER는 실제 BRDF 데이터셋을 기반으로 훈련된 잠재 BRDF 오토인코더를 사용하여 환경 조명과 물질을 분리하는 물질 인식 텍스트-3D 생성 프레임워크를 제안한다. 원시 BRDF 매개변수 대신 잠재 BRDF 코드를 예측하기 때문에 고해상도이고 현실적인 물질을 구현할 수 있으며, 이는 재조명 및 물질 편집을 가능하게 하여 이전 방법들보다 현실성, 세부 사항, 분리도에서 뛰어난 성능을 발휘한다.
Based on powerful text-to-image diffusion models, text-to-3D generation has made significant progress in generating compelling geometry and appearance. However, existing methods still struggle to recover high-fidelity object materials, either only considering Lambertian reflectance, or failing to disentangle BRDF materials from the environment lights. In this work, we propose Material-Aware Text-to-3D via LAtent BRDF auto-EncodeR ( extbf{MATLABER}) that leverages a novel latent BRDF auto-encoder for material generation. We train this auto-encoder with large-scale real-world BRDF collections and ensure the smoothness of its latent space, which implicitly acts as a natural distribution of materials. During appearance modeling in text-to-3D generation, the latent BRDF embeddings, rather than BRDF parameters, are predicted via a material network. Through exhaustive experiments, our approach demonstrates the superiority over existing ones in generating realistic and coherent object materials. Moreover, high-quality materials naturally enable multiple downstream tasks such as relighting and material editing. Code and model will be publicly available at \url{https://sheldontsui.github.io/projects/Matlaber}.
연구 동기 및 목표
- 기존 텍스트-3D 생성 방법이 환경 조명과 분리된 고해상도이고 현실적인 물질을 생성하는 데에 한계가 있음을 해결하기 위해.
- 대규모 실세계 BRDF 컬렉션(예: TwoShotBRDF)을 활용하여 잠재 공간에서 자연스럽고 연속적인 물질 분포를 학습하기 위해.
- 정확하고 편집 가능한 BRDF 표현을 생성함으로써 재조명 및 물질 편집과 같은 후속 응용을 가능하게 하기 위해.
- 직접 BRDF 예측을 잠재 코드 최적화로 대체함으로써 텍스트-3D 합성의 외관 품질과 일관성을 향상시키기 위해.
제안 방법
- 대규모 실세계 BRDF 데이터(예: TwoShotBRDF)를 기반으로 훈련된 새로운 잠재 BRDF 오토인코더를 도입하여 자연스러운 물질 분포를 나타내는 부드럽고 연속적인 잠재 공간을 학습한다.
- 오토인코더는 원시 BRDF를 압축되고 분리된 잠재 코드로 매핑하며, 이는 텍스트-3D 파이프라인에서 물질 생성을 위한 사전 지식으로 기능한다.
- 텍스트-3D 생성 과정에서 물질 네트워크는 원시 BRDF 매개변수를 예측하는 대신, 텍스트 프롬프트에 조건화된 잠재 BRDF 임베딩을 예측한다.
- NeRF 또는 DMTet 표현을 사용하는 확산 기반 3D 생성 프레임워크(예: SDS 손실)를 활용하며, 외관은 예측된 잠재 BRDF 코드를 사용해 최적화된다.
- 잠재 공간의 부드러움 덕분에 다양한 조명 조건에서도 현실적이고 일관성 있는 물질 생성이 보장된다.
- 잠재 BRDF 코드의 보간을 통해 재조명 및 물질 편집을 지원하며, 서로 다른 물질 유형 간 자연스러운 변형을 가능하게 한다.
실험 결과
연구 질문
- RQ1실세계 BRDF 데이터로 훈련된 잠재 BRDF 오토인코더가 텍스트-3D 생성에서 물질과 환경 조명을 효과적으로 분리할 수 있는가?
- RQ2원시 BRDF 매개변수 대신 잠재 BRDF 코드를 예측하는 것이 더 현실적이고 일관성 있는 물질 생성을 이끌어내는가?
- RQ3생성된 BRDF 물질이 재조명 및 물질 편집과 같은 실용적 후속 작업을 지원할 수 있는가?
- RQ4최첨단 텍스트-3D 모델 대비 제안된 방법이 물질의 현실성, 세부 사항, 분리도 측면에서 어떻게 비교되는가?
주요 결과
- 사용자 연구를 통해 MATLABER가 DreamFusion, Magic3D, Fantasia3D와 비교해 물질의 현실성, 세부 사항의 풍부함, 분리도에서 뛰어난 성능을 보였으며, 특히 분리도 점수에서 유의미한 격차를 보였다.
- 80명의 참가자로 진행된 사용자 연구 결과, MATLABER는 모든 베이스라인 대비 현실성, 세부 사항, 분리도에서 모두 뛰어난 성능을 보였으며, 분리도 점수에서 뚜렷한 우위를 점했다.
- 다양한 HDR 환경 맵을 적용한 재조명에서도 MATLABER는 일관되고 자연스러운 외관 변화를 보이며 사진 수준의 재조명을 가능하게 했다.
- 잠재 코드 혼합을 통한 물질 간 보간은 골드에서 은으로의 변형 등, 물체(예: 컵)에 대해 매끄럽고 시각적으로 타당한 전환을 생성했다.
- 고해상도의 물질 편집 및 시나리오 조작을 지원하며, 이전 텍스트-3D 모델로는 이룩하기 어려웠던 응용을 가능하게 했다.
- 고품질의 물질을 제공함에도 불구하고, 기하구조가 불완전하여 새로운 조명 조건에서 잡음이 발생하는 경우가 있어, 향후 기하구조 정밀화 작업이 필요하다고 나타났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.