[논문 리뷰] HumanGaussian: Text-Driven 3D Human Generation with Gaussian Splatting
HumanGaussian는 3D 가우시안 스플래터링(3DGS)을 사용하여 구조 인식 스코어 디스틸레이션 샘플링(SDS)과 안내된 음성 프롬프트 가이던스를 통합한 텍스트 기반 3D 인간 생성 프레임워크를 제안한다. SMPL-X 메시에 가우시안를 초기화하고 이중 브랜치(RGB + 깊이) SDS를 활용함으로써, 현실적인 외관과 세밀한 기하학적 구조를 갖춘 고해상도 3D 인간을 생성한다. 이는 기존 방법보다 품질과 효율성 면에서 뛰어나며, 저수준의 분류기 자유 가이던스(CFG) 스케일에서도 과도한 색조 포화 현상을 방지한다.
Realistic 3D human generation from text prompts is a desirable yet challenging task. Existing methods optimize 3D representations like mesh or neural fields via score distillation sampling (SDS), which suffers from inadequate fine details or excessive training time. In this paper, we propose an efficient yet effective framework, HumanGaussian, that generates high-quality 3D humans with fine-grained geometry and realistic appearance. Our key insight is that 3D Gaussian Splatting is an efficient renderer with periodic Gaussian shrinkage or growing, where such adaptive density control can be naturally guided by intrinsic human structures. Specifically, 1) we first propose a Structure-Aware SDS that simultaneously optimizes human appearance and geometry. The multi-modal score function from both RGB and depth space is leveraged to distill the Gaussian densification and pruning process. 2) Moreover, we devise an Annealed Negative Prompt Guidance by decomposing SDS into a noisier generative score and a cleaner classifier score, which well addresses the over-saturation issue. The floating artifacts are further eliminated based on Gaussian size in a prune-only phase to enhance generation smoothness. Extensive experiments demonstrate the superior efficiency and competitive quality of our framework, rendering vivid 3D humans under diverse scenarios. Project Page: https://alvinliu0.github.io/projects/HumanGaussian
연구 동기 및 목표
- 텍스트 프롬프트에서 고해상도 3D 인간을 세밀한 기하학적 구조와 현실적인 외관을 갖춰 생성하는 데 도전하는 것.
- 메ッシュ나 신경 장치 기반 기존 3D 생성 방법의 한계를 해결하는 것—즉, 세부 사항 캡처 부족 또는 높은 학습 비용 문제.
- 기존에 복구 작업에 사용된 3D 가우시안 스플래터링(3DGS)을 텍스트 기반 3D 생성 프레임워크로 적응시키며, 최적화 안정성과 구조적 정확도를 향상시키는 것.
- 확산 기반 3D 생성에서의 과도한 색조 포화 및 부유 물체 아티팩트 문제를 해결하기 위해 안내된 음성 프롬프트 가이던스와 크기 조건 기반 정리 기법을 도입하는 것.
- 다중 시점 감시나 복잡한 최적화 파이프라인 없이도 텍스트 프롬프트만으로 효율적이고 제어 가능한 3D 인간 생성을 가능하게 하는 것.
제안 방법
- 구조 인식 SDS는 SMPL-X 메시에 가우시안를 초기화하고, RGB 및 깊이 공간에서의 다중 모odal 스코어 함수를 활용해 외관과 기하학을 동시에 최적화한다.
- 이중 브랜치 SDS는 사전 학습된 Stable Diffusion 모델을 확장하여 RGB 및 깊이 이미지를 동시에 노이즈 제거함으로써 최적화 과정에서 외관과 구조적 가이던스를 통합한다.
- 안내된 음성 프롬프트 가이던스는 SDS 손실을 더 노이지한 생성 스코어와 더 깔끔한 분류기 스코어로 분리하며, 학습 중 후자를 점차 감소시켜 저수준 CFG 스케일(예: 7.5)에서의 과도한 색조 포화를 방지한다.
- 크기 조건 기반 가우시안 정리는 별도의 정리 전용 단계에서 수행되어 크기 기준 이하의 가우시안를 제거함으로써 작은 부유 아티팩트를 효과적으로 제거한다.
- 이 프레임워크는 3DGS의 효율적 래스터라이제이션과 적응형 밀도 제어를 활용하며, 밀도 증가 및 정리 과정이 내재된 인간 신체 구조와 다중 시점 일致성에 의해 이끌린다.
- 이 방법은 인간 전문 지식(SMPL-X 및 뼈대 자세)을 직접 SDS 최적화 과정에 통합하여 기하학적 일관성 향상과 아티팩트 감소를 달성한다.

실험 결과
연구 질문
- RQ13D 가우시안 스플래터링은 구조적 정확도와 외관 정확도를 고려할 때 텍스트 기반 3D 인간 생성에 효과적으로 적용될 수 있는가?
- RQ2SMPL-X 및 자세 가이던스와 같은 구조적 사전 지식은 3DGS 기반 생성에서 최적화 안정성과 세부 사항 캡처에 어떻게 기여하는가?
- RQ3안내된 음성 프롬프트 가이던스는 저수준의 분류기 자유 가이던스(CFG) 스케일에서 과도한 색조 포화를 줄이고 현실감을 향상시키는 데 효과적인가?
- RQ4이중 브랜치(RGB + 깊이) SDS는 단일 브랜치 감시 대비 기하학적 일致성과 텍스처 현실감을 어떻게 향상시키는가?
- RQ5크기 조건 기반 정리는 3DGS 기반 3D 생성에서 부유 아티팩트를 어느 정도 효과적으로 제거할 수 있는가?
주요 결과
- HumanGaussian는 17명의 사용자 평가자들 대상으로 평균 평가 점수(MOS)에서 외관 품질 4.24, 기하학적 품질 3.88, 텍스트 일치도 4.71을 기록하여 기존 방법보다 뚜렷이 뛰어난 성능을 보였다.
- 안내된 음성 프롬프트 가이던스를 통해 과도한 색조 포화 문제를 감소시켜, 기존에 100과 같은 높은 값이 필요로 했던 CFG 스케일 7.5에서도 고품질 결과를 도출할 수 있었다.
- 크기 조건 기반 정리는 인간 표면 근처의 부유 아티팩트를 효과적으로 제거하여 최종 3D 출력물의 시각적 매끄러움과 현실감을 향상시켰다.
- 이중 브랜치 SDS(RGB + 깊이)는 단일 브랜치 감시 대비, 팔다리나 머리카락과 같은 도전적인 영역에서 더 우수한 기하학적 정규화를 이끌어냈다.
- SMPL-X를 초기화 사전 지식으로 통합함으로써 구조적 일관성이 크게 향상되었고, 기존 3DGS 생성에서 나타나는 다면체 장우신 문제를 줄였다.
- HumanGaussian는 다중 시점 또는 형태 사전 지식을 통합한 기존 3DGS 기반 기준 모델 및 DreamHuman, TADA와 같은 최신 SOTA 방법 대비 우수한 효율성과 품질을 확보했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.