[논문 리뷰] MoFusion: A Framework for Denoising-Diffusion-based Motion Synthesis
MoFusion은 조건부 3D 인간 동작 합성에 대한 첫 번째 노이즈 제거 확산 기반 프레임워크를 도입하여, 텍스트 및 오디오 조건부로 고품질, 다양한, 시간적으로 타당한 동작 생성을 가능하게 한다. 운동 역학 제약를 통합하는 시간에 따라 변화하는 손실 가중 전략을 통해 최신 기술 수준의 성능을 달성하며, 텍스트에서 동작으로 및 음악에서 안무로의 작업 모두에서 뛰어난 현실감과 의미 정확성을 확보한다.
Conventional methods for human motion synthesis are either deterministic or struggle with the trade-off between motion diversity and motion quality. In response to these limitations, we introduce MoFusion, i.e., a new denoising-diffusion-based framework for high-quality conditional human motion synthesis that can generate long, temporally plausible, and semantically accurate motions based on a range of conditioning contexts (such as music and text). We also present ways to introduce well-known kinematic losses for motion plausibility within the motion diffusion framework through our scheduled weighting strategy. The learned latent space can be used for several interactive motion editing applications -- like inbetweening, seed conditioning, and text-based editing -- thus, providing crucial abilities for virtual character animation and robotics. Through comprehensive quantitative evaluations and a perceptual user study, we demonstrate the effectiveness of MoFusion compared to the state of the art on established benchmarks in the literature. We urge the reader to watch our supplementary video and visit https://vcai.mpi-inf.mpg.de/projects/MoFusion.
연구 동기 및 목표
- 조건부 3D 인간 동작 합성에서 동작의 다양성과 품질 간의 상충 관계를 해결한다.
- GAN의 모드 붕괴 및 VAE의 잠재 공간 상충 등의 이전 방법의 한계를 극복한다.
- 텍스트와 음악과 같은 다양한 입력 조건에 따라 장시간, 시간적으로 일관되고 의미적으로 일치하는 동작 시퀀스 생성을 가능하게 한다.
- 가상 애니메이션 및 로봇 공학 분야에서 실용적인 응용을 위해 중간 보간 및 시드 조건 기반 예측과 같은 상호작용 편집 기능을 도입한다.
- 특히 새로운 오디오 입력에 대한 음악 조건 기반 안무 생성에서 훈련 분포를 초월한 일반화 능력을 향상시킨다.
제안 방법
- 비자기적 3D 동작 생성을 위해 노이즈 제거 확산 확률 모델(Denoising Diffusion Probabilistic Model, DDPM)을 채택하며, 효율적인 역노이즈 처리를 위해 경량 1D U-Net을 사용한다.
- 훈련 중에 다중 운동 역학 손실 간의 동적 균형을 확보하기 위해 시간에 따라 변화하는 손실 가중 전략을 도입하여 동작의 타당성과 시간적 일관성을 향상시킨다.
- 교차 어텐션 메커니즘을 통해 텍스트 또는 오디오 임베딩을 조건부로 사용하여 다중 모odal 제어를 가능하게 한다.
- 예측 및 중간 보간 과정에서 시드 시퀀스를 유지하기 위해 마스크된 노이즈 제거 과정을 활용하여 구조적 일관성을 확보한다.
- 코드북 기반 방법에 비해 더 뛰어난 다양성과 동작 플리커에 대한 강건성을 확보하기 위해 운동 표현을 위한 학습된 잠재 공간을 활용한다.
- 조건부 신호와 운동 역학 제약에 따라 점차적으로 노이즈를 제거하는 노이즈 스케줄을 적용한다.
실험 결과
연구 질문
- RQ1장시간 시퀀스에 대해 노이즈 제거 확산 모델이 조건부 3D 인간 동작 합성에 효과적으로 적용될 수 있는가?
- RQ2다양성이나 품질을 훼손하지 않으면서 운동 역학 타당성을 확산 훈련 과정에 통합할 수 있는가?
- RQ3MoFusion은 훈련 분포 외부의 새로운 음악이나 텍스트 프롬프트에 일반화될 수 있는가?
- RQ4제안된 시간에 따라 변화하는 손실 가중 전략은 고정 가중 전략 대비 동작의 현실감과 의미 일치도를 어떻게 향상시키는가?
- RQ5MoFusion은 중간 보간 및 시드 조건 기반 예측과 같은 상호작용 편집 작업을 어느 정도 지원할 수 있는가?
주요 결과
- MoFusion은 HumanML3D 및 AIST++ 벤치마크에서 최신 기술 수준의 성능을 달성하여 FID 8.82와 FVD 2.521을 기록하며, T2M 및 MotionDiffuse를 포함한 이전 방법들을 능가한다.
- 사용자 연구에서 MoFusion은 비교 시 51.4%의 경우에서 참조 안무보다 더 현실감 있게 평가되었고, T2M 및 MotionDiffuse보다 52.3%의 경우에서 더 의미 정확도가 높았다.
- 모델은 훈련 분포 외부의 음악에 대해서도 잘 일반화되어 반복적이지 않고 리듬에 맞는 안무를 생성한다.
- 큰 잠재 공간과 비자기적 생성 덕분에 평균 자세로 수렴하거나 동작 플리커가 발생하지 않으며, 이를 해결한다.
- 마스크된 노이즈 제거를 통해 시드 조건 기반 예측 및 중간 보간과 같은 상호작용 편집 작업이 성공적으로 가능해졌으며, 애니메이션 및 로봇 공학 분야에서 실용적인 응용 가능성을 입증한다.
- 시간에 따라 변화하는 손실 가중 전략은 동작 타당성을 크게 향상시켜 고정 가중 전략 대비 더 뛰어난 시간적 일관성과 운동 역학 정확도를 확보한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.