Skip to main content
QUICK REVIEW

[논문 리뷰] Diffusion-based Generation, Optimization, and Planning in 3D Scenes

Siyuan Huang, Zan Wang|arXiv (Cornell University)|2023. 01. 15.
Human Pose and Action Recognition인용 수 6
한 줄 요약

SceneDiffuser는 조건부 3D 시나리오 생성, 물리 기반 최적화, 목표 지향적 계획을 위한 통합된 확산 기반 프레임워크를 제안한다. 시나리오, 물리 법칙, 목표 조건에 의해 이끌리는 가역적이고 반복적인 샘플링 과정을 통해 궤적을 동시에 노이즈 제거함으로써, 후행 분포 붕괴를 완화하고 다양한 3D 작업(예: 인간 운동, 잡기, 주행)에서 일관되고 물리적으로 타당하며 일반화 가능한 생성 및 계획을 가능하게 한다.

ABSTRACT

We introduce SceneDiffuser, a conditional generative model for 3D scene understanding. SceneDiffuser provides a unified model for solving scene-conditioned generation, optimization, and planning. In contrast to prior works, SceneDiffuser is intrinsically scene-aware, physics-based, and goal-oriented. With an iterative sampling strategy, SceneDiffuser jointly formulates the scene-aware generation, physics-based optimization, and goal-oriented planning via a diffusion-based denoising process in a fully differentiable fashion. Such a design alleviates the discrepancies among different modules and the posterior collapse of previous scene-conditioned generative models. We evaluate SceneDiffuser with various 3D scene understanding tasks, including human pose and motion generation, dexterous grasp generation, path planning for 3D navigation, and motion planning for robot arms. The results show significant improvements compared with previous models, demonstrating the tremendous potential of SceneDiffuser for the broad community of 3D scene understanding.

연구 동기 및 목표

  • 복잡하고 고차원적인 조건을 가진 자연스러운 3D 시나리오에서 특히 두드러지는 조건부 3D 생성 모델의 후행 분포 붕괴 문제를 해결한다.
  • 기존에 별개로 존재하던 3D 시나리오 생성, 물리 기반 최적화, 궤적 계획 모듈을 하나의 미분 가능한 프레임워크로 통합한다.
  • 시나리오 인지성, 물리적 타당성, 목표 지향성에 동시에 최적화되는 종단 간 반복적이고 이입된 샘플링을 가능하게 한다.
  • 노이즈 제거 과정에 계획 목표를 통합함으로써 장기 계획 및 새로운 시나리오 전이에서의 일반화 능력과 견고성을 향상시킨다.
  • 후행 최적화 및 독립된 계획 모듈의 일관성 부족과 타당성 결여 문제를 해결하기 위해 최적화 및 계획을 생성 샘플링 루프 내부에 통합한다.

제안 방법

  • 3D 시나리오 조건부 궤적을 공동으로 반복적인 샘플링 과정에서 노이즈 제거하는 조건부 확산 모델을 수립한다.
  • 물리 기반 목표를 노이즈 제거 중 조건부 가이드라인으로 통합하여 물리적 타당성을 위한 미분 가능한 최적화를 가능하게 한다.
  • 목표 조건부를 계획 목표 함수를 통해 통합하여 궤적이 목표 위치에 도달하도록 유도하며, 프레임 단위 또는 최종 프레임 손실 옵션을 제공한다.
  • 일부 궤적 프레임(예: 시작 또는 목표)을 고정하는 인painting 방식의 노이즈 제거 전략을 사용하여 구조적인 계획을 가능하게 한다.
  • 소규모 MLP를 통해 최적화 가이드라인을 위한 학습 가능한 스케일링 인자를 도입하여 노이즈 제거 단계 전반에 걸쳐 물리 제약의 가중치를 적응적으로 조정한다.
  • 자기 모델과 샘플링 과정을 다양한 작업—자세 생성, 운동, 잡기, 주행, 로봇 암 운동—에 동일하게 적용하며, 작업별 조건부 및 목표를 통해 조절한다.

실험 결과

연구 질문

  • RQ1통합된 확산 기반 프레임워크가 3D 시나리오 생성, 물리 기반 최적화, 목표 지향적 계획을 함께 해결하면서 일관성과 다양성을 향상시킬 수 있는가?
  • RQ2물리 법칙과 목표 조건부를 통한 반복적이고 이입된 노이즈 제거가 cVAE 기반 모델에 비해 3D 시나리오 생성에서 후행 분포 붕괴를 얼마나 줄이는가?
  • RQ3최적화 및 계획을 생성 샘플링 과정에 통합함으로써 물리적 타당성 향상과 새로운 시나리오로의 일반화 능력 향상에 어느 정도 기여하는가?
  • RQ4확산 기반 계획 프레임워크에서 특정 프레임(예: 시작 또는 목표)을 고정하고 계획 목표를 설계하는 데 최적의 전략은 무엇인가? (예: 목표까지의 L1 거리)
  • RQ5단일의 미분 가능한 모델이 최소한의 아키텍처 변경으로 운동, 잡기, 주행 등의 다양한 3D 시나리오 이해 작업에 일반화될 수 있는가?

주요 결과

  • SceneDiffuser는 3D 주행 경로 계획에서 75.69%의 성공률을 기록하여, 최종 프레임 손실만을 사용하는 모델(57.06%)이나 지수 변환을 적용한 모델(34.31%)을 능가한다.
  • 모든 궤적 프레임을 최적화할 경우 평균 계획 단계를 116.22에서 88.02로 감소시켜 더 효율적이고 일관된 계획이 가능함을 확인하였다.
  • 인간 운동 생성에서 SceneDiffuser는 복잡한 실내 3D 시나리오에 조건부된 다양한 물리적 타당성 있는 운동을 생성하며, cVAE 기반 모델에서 흔히 발생하는 모드 붕괴를 피한다.
  • 다재도 있는 그립 생성에서 모델은 훈련 데이터 외부의 3D 물체에 대해 유효한 그립 자세를 성공적으로 생성하여 훈련 데이터를 초월한 강력한 일반화 능력을 보였다.
  • 물리 가이드라인을 위한 학습된 스케일링 인자는 노이즈 제거 단계가 진행될수록 감소함을 확인하여, 초기 노이즈가 많은 단계에서 과도한 최적화를 방지하는 적응형 가중치 조정이 이루어짐을 시사한다.
  • 절단 분석 결과, 32프레임 궤적에서 첫 15프레임을 고정하는 것이 가장 뛰어난 계획 성능을 보였으며, 제약과 유연성 사이의 최적 균형을 이룬다는 것을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.