[논문 리뷰] DiverseMotion: Towards Diverse Human Motion Generation via Discrete Diffusion
DiverseMotion는 텍스트-모션 생성에서 운동 품질과 다양성 간 최신 기술 수준의 균형을 달성하는 새로운 운동 이산 확산(Motion Discrete Diffusion, MDD) 프레임워크를 제안한다. 8,888개의 운동 클립과 141만 개의 다양한 문장 설명을 포함하는 대규모 Wild Motion-Caption(WMC) 데이터셋을 도입하고, 다층적 의미 집약(Hierarchical Semantic Aggregation, HSA) 모듈을 활용하여 세밀한 텍스트 의미를 포착함으로써, HumanML3D 및 KIT-ML 벤치마크에서 높은 생성 품질을 유지하면서도 운동의 다양성을 크게 향상시켰다.
We present DiverseMotion, a new approach for synthesizing high-quality human motions conditioned on textual descriptions while preserving motion diversity.Despite the recent significant process in text-based human motion generation,existing methods often prioritize fitting training motions at the expense of action diversity. Consequently, striking a balance between motion quality and diversity remains an unresolved challenge. This problem is compounded by two key factors: 1) the lack of diversity in motion-caption pairs in existing benchmarks and 2) the unilateral and biased semantic understanding of the text prompt, focusing primarily on the verb component while neglecting the nuanced distinctions indicated by other words.In response to the first issue, we construct a large-scale Wild Motion-Caption dataset (WMC) to extend the restricted action boundary of existing well-annotated datasets, enabling the learning of diverse motions through a more extensive range of actions. To this end, a motion BLIP is trained upon a pretrained vision-language model, then we automatically generate diverse motion captions for the collected motion sequences. As a result, we finally build a dataset comprising 8,888 motions coupled with 141k text.To comprehensively understand the text command, we propose a Hierarchical Semantic Aggregation (HSA) module to capture the fine-grained semantics.Finally,we involve the above two designs into an effective Motion Discrete Diffusion (MDD) framework to strike a balance between motion quality and diversity. Extensive experiments on HumanML3D and KIT-ML show that our DiverseMotion achieves the state-of-the-art motion quality and competitive motion diversity. Dataset, code, and pretrained models will be released to reproduce all of our results.
연구 동기 및 목표
- 기존의 텍스트-모션 생성 모델에서 발생하는 반복적이고 템플릿 유형의 운동 생성 문제를 해결하기 위해, 높은 품질임에도 불구하고 다양성이 부족한 점을 보완한다.
- 현재의 운동 벤치마크에서 제한된 동작 커버리지로 인해 모델이 다양한 운동 패턴을 학습하는 데 어려움을 겪는 문제를 해결한다.
- 행동 동사 외에도 복잡하거나 묘사적인 표현에서의 미묘한 의미 차이를 포착함으로써, 텍스트 프롬프트의 의미 이해를 향상시킨다.
- 사전 학습된 시각-언어 모델을 활용하여 자동화된, 확장 가능한 파이프라인을 개발하여 다양한 고품질의 운동-문장 데이터셋을 구축한다.
- 텍스트 조건부 모션 생성에서 운동 품질(FID 기준)과 운동 다양성(MM-Dist 기준) 간의 균형 잡힌 트레이드오프를 달성한다.
제안 방법
- 저자들은 기존의 운동-텍스트 쌍을 기반으로 운동 BLIP를 미세조정하여, 8,888개의 운동 시퀀스에 대해 141만 개의 다양한 문장 설명을 자동으로 생성함으로써 Wild Motion-Caption(WMC) 데이터셋을 구축한다.
- CLIP 기반 텍스트 인코더에서 유도된 다층 텍스트 임베딩을 융합하기 위해 다층적 의미 집약(Hierarchical Semantic Aggregation, HSA) 모듈을 제안하여, 저수준 세부 정보와 고수준 의미를 통합함으로써 의미 표현을 향상시킨다.
- VQ-VAE 기반의 운동 토크나이저와 이산 확산 모델을 기반으로 한 운동 이산 확산(Motion Discrete Diffusion, MDD) 프레임워크를 구축하며, 운동 시퀀스를 효율적인 생성을 위해 이산 토큰으로 모델링한다.
- 분류기 없는 가이던스를 추론 중에 사용하여 스케일 초모수를 통해 운동-텍스트 일치도와 생성 다양성 간의 트레이드오프를 제어한다.
- MDD 프레임워크는 HSA로 인코딩된 텍스트 임베딩을 조건으로 삼아 정밀하고 다양한 운동 생성을 가능하게 한다.
- 모델은 HumanML3D 및 KIT-ML에서 훈련 및 평가되며, HSA 및 확산 단계 설정에 대한 광범위한 추상화 연구가 수행된다.

실험 결과
연구 질문
- RQ1대규모이고 다양한 운동-문장 데이터셋이 텍스트-모션 생성에서 생성된 인간 운동의 다양성에 상당한 영향을 미칠 수 있는가?
- RQ2다층적 텍스트 인코딩이 행동 동사 외의 자연어 프롬프트에서 미묘한 차이를 이해하는 데 모델의 능력을 어떻게 향상시키는가?
- RQ3분류기 없는 가이던스를 활용한 이산 확산 모델링을 통해 텍스트 조건부 생성에서 운동 품질과 다양성 간의 균형을 어느 정도 잘 조절할 수 있는가?
- RQ4기본적인 텍스트 인코딩 대비 제안된 HSA 모듈이 장문이거나 복잡한 텍스트 프롬프트에서 성능 향상에 기여하는가?
- RQ5운동 품질과 다양성 간 최적의 트레이드오프를 달성하기 위해 필요한 확산 단계의 최적 수는 얼마인가?
주요 결과
- DiverseMotion는 HumanML3D 벤치마크에서 FID 0.070의 새로운 최고 기록을 달성하여 기준 모델 대비 48% 향상되고 이전 최고 기록 모델 대비 40% 향상되었다.
- 모델은 HumanML3D에서 Top-1 정확도 0.496과 Top-3 정확도 0.783을 기록하여 강력한 운동-텍스트 일치도와 높은 생성 다양성을 입증했다.
- HSA 모듈은 표준 CLIP 토큰 임베딩을 사용한 기준 모델 대비 FID를 48% 향상시켰으며, 더 긴 복잡한 프롬프트에서는 더 큰 성과 향상(고급 MM-Dist-L 향상 0.057)을 보였다.
- 추상화 분석 결과, 100개의 확산 단계가 품질과 다양성 간 최적의 균형을 이끌어내며, 30단계(낮은 설정)와 120단계(높은 설정)에서는 성능이 떨어지는 것으로 나타났다.
- 스케일 s=100인 분류기 없는 가이던스를 사용할 경우, 텍스트-운동 일치도가 실제 운동보다 높아졌으며(실제 운동 대비 Top-1: 0.496 vs. 0.511), 同시에 높은 다양성을 유지했다.
- 정성적 결과에서는 DiverseMotion가 동일한 프롬프트에 대해 여러 가지 타당하고 서로 다른 운동을 생성하는 반면, 이전 최고 기록 모델들은 매우 유사한 출력을 생성하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.