Skip to main content
QUICK REVIEW

[논문 리뷰] Language-driven Scene Synthesis using Multi-conditional Diffusion Model

An Vuong, Minh Nhat Vu|arXiv (Cornell University)|2023. 10. 24.
Human Motion and Animation인용 수 4
한 줄 요약

이 논문은 텍스트 프롬프트, 인간의 운동, 기존 객체를 활용하여 3D 장면을 생성하는 언어 기반 장면 합성 작업을 소개한다. 이는 노이즈 제거 과정을 안내하기 위한 명시적 지시점이 포함된 새로운 다중 조건 확산 모델을 활용한다. 이 방법은 PRO-teXt 및 HUMANISE 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하여 FID 및 3D IP 지표에서 기존 기준들보다 뚜렷이 뛰어나며, 텍스트 명령어를 통한 객체 교체 및 형태 변경과 같은 고급 편집 기능도 가능하게 한다.

ABSTRACT

Scene synthesis is a challenging problem with several industrial applications. Recently, substantial efforts have been directed to synthesize the scene using human motions, room layouts, or spatial graphs as the input. However, few studies have addressed this problem from multiple modalities, especially combining text prompts. In this paper, we propose a language-driven scene synthesis task, which is a new task that integrates text prompts, human motion, and existing objects for scene synthesis. Unlike other single-condition synthesis tasks, our problem involves multiple conditions and requires a strategy for processing and encoding them into a unified space. To address the challenge, we present a multi-conditional diffusion model, which differs from the implicit unification approach of other diffusion literature by explicitly predicting the guiding points for the original data distribution. We demonstrate that our approach is theoretically supportive. The intensive experiment results illustrate that our method outperforms state-of-the-art benchmarks and enables natural scene editing applications. The source code and dataset can be accessed at https://lang-scene-synth.github.io/.

연구 동기 및 목표

  • 텍스트, 인간의 운동, 기존 객체와 같은 다중 모odal을 통합하는 장면 합성의 격차를 메우기 위해 새로운 언어 기반 장면 합성 작업을 제안한다.
  • 기존의 잠재 공간 내에서 조건을 암묵적으로 융합하는 단일 조건 합성 방법의 한계를 극복한다.
  • 공간적 위치와 형태를 모두 포괄하는 3D 포인트 클라우드 기반의 장면 표현 방식을 개발하여 더 정확하고 세밀한 장면 생성을 가능하게 한다.
  • 사용자가 자연어 명령어로 장면을 수정할 수 있도록 실용적이고 직관적인 장면 편집을 가능하게 한다.

제안 방법

  • 텍스트, 운동, 객체 입력에서 유도된 지시점을 명시적으로 모델링하여 노이즈 제거 과정을 이끄는 다중 조건 확산 모델을 제안하며, 이는 이전 연구에서의 암묵적 통합 방식과 다릅니다.
  • 텍스트, 운동, 객체 입력에서 예측된 지시점이 확산 과정의 노이즈 제거 단계에 직접 영향을 주는 '지시점'이라는 새로운 개념을 도입합니다.
  • CLIP을 텍스트용, PoseNet을 인간 운동용, PointNet++/DGCNN을 3D 포인트 클라우드용으로 사용하는 통합 인코더 아키텍처를 활용하고, 조건을 융합하기 위해 교차 attention 메커니즘을 적용합니다.
  • 지시점을 조건부로 삽입한 노이즈 제거 U-Net을 사용하여 역방향 확산 과정을 의미론적이고 물리적으로 타당한 장면 생성 방향으로 이끕니다.
  • 텍스트 프롬프트와 생성된 3D 장면 간의 정렬을 향상시키기 위해 대비 학습 기반 손실을 활용합니다.
  • 가소성 연구 및 사용자 연구를 통해 지시점과 구성 요소 선택의 효과를 확인합니다.

실험 결과

연구 질문

  • RQ1텍스트 프롬프트, 인간의 운동, 기존 객체를 동시에 조건으로 삼아 다중 조건 확산 모델이 효과적으로 3D 장면을 합성할 수 있는가?
  • RQ2다중 조건 확산 모델에서 잠재 공간 내 암묵적 통합 대비 명시적 지시점 예측이 생성 품질에 어떻게 기여하는가?
  • RQ3텍스트 명령어를 통한 언어 기반 장면 편집(예: 객체 교체, 형태 변경, 이동)은 어느 정도의 수준까지 가능해지는가?
  • RQ4다양한 백본 아키텍처(예: PointNet++, DGCNN)와 텍스트 인코더(예: CLIP, BERT)의 조합이 모델 성능에 어떤 영향을 미치는가?
  • RQ5사용자 연구를 통해 제안된 방법이 다양한 데이터셋과 사용자 선호도에 일반화되는가?

주요 결과

  • 제안된 LSDM 모델은 PRO-teXt 데이터셋에서 3D IP 0.0402 및 FID 161.05를 기록하여 ATISS, SUMMON, MIME를 포함한 모든 기준 모델을 앞서며 뛰어난 성능을 보였다.
  • HUMANISE 데이터셋에서 LSDM은 최신 기술 수준의 방법들 대비 FID를 최소 35% 이상 감소시켜 장면의 현실성 향상이 뚜렷하게 입증되었다.
  • CLIP, POSA, PointNet++의 조합이 EMD 및 F1 점수에서 최고 성능을 기록했으며, 최고 성능 구성 대비 CD 지표에서 단지 0.1866 단위의 감소만을 보였다.
  • 가소성 연구 결과, CLIP 및 PointNet++와 함께 사용할 경우 POSA가 P2R보다 F1 점수에서 약 3배 높은 성능을 보였다.
  • 사용자 연구 결과, LSDM이 생성한 장면은 자연스러움, 충돌 없음, 의도 일치도에서 기준 모델 대비 유의미하게 높은 평가를 받았다.
  • 모델의 성능는 다양한 수의 인간 자세 프레임에 대해 안정적이며, 단일 프레임만 사용할 경우에도 최소한의 성능 저하를 보여, 강인성과 효율성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.