Skip to main content
QUICK REVIEW

[논문 리뷰] MotionGPT: Finetuned LLMs Are General-Purpose Motion Generators

Yaqi Zhang, Di Huang|arXiv (Cornell University)|2023. 06. 19.
Human Pose and Action Recognition인용 수 4
한 줄 요약

MotionGPT는 텍스트와 단일 프레임 자세와 같은 다중 모odal 제어 신호를 이용해 인간의 운동 시퀀스를 생성하기 위해 미세조정된 대규모 언어 모델(Large Language Models, LLMs)을 활용하는 통합된 인간 운동 생성 프레임워크입니다. 이는 이러한 신호들을 이산 토큰으로 변환하고 LLM에 프롬프트를 제공함으로써 작동합니다. LoRA를 통해 총 파라미터의 0.4%만을 미세조정함으로써 최신 기술 수준(SOTA)의 성능을 달성하며, 보간, 이어짐, 关건 자세에 조건화된 등 다양한 작업에 유연한 운동 생성을 가능하게 합니다.

ABSTRACT

Generating realistic human motion from given action descriptions has experienced significant advancements because of the emerging requirement of digital humans. While recent works have achieved impressive results in generating motion directly from textual action descriptions, they often support only a single modality of the control signal, which limits their application in the real digital human industry. This paper presents a Motion General-Purpose generaTor (MotionGPT) that can use multimodal control signals, e.g., text and single-frame poses, for generating consecutive human motions by treating multimodal signals as special input tokens in large language models (LLMs). Specifically, we first quantize multimodal control signals into discrete codes and then formulate them in a unified prompt instruction to ask the LLMs to generate the motion answer. Our MotionGPT demonstrates a unified human motion generation model with multimodal control signals by tuning a mere 0.4% of LLM parameters. To the best of our knowledge, MotionGPT is the first method to generate human motion by multimodal control signals, which we hope can shed light on this new direction. Visit our webpage at https://qiqiapink.github.io/MotionGPT/.

연구 동기 및 목표

  • 기존의 운동 생성 모델이 텍스트나 자세 중 하나의 제어 모odal만 지원하는 한계를 해결하기 위해.
  • 텍스트 기술서와 关건 프레임 자세를 포함한 다중 제어 신호에 기반해 인간 운동 시퀀스를 생성할 수 있는 통합 프레임워크를 개발하기 위해.
  • 프롬프트 기반 지시 미세조정 파라다임에서 다중 모달 입력을 이산 토큰으로 간주함으로써 사전 학습된 LLM을 운동 생성에 효과적으로 적응시킬 수 있는지 탐색하기 위해.
  • 다양한 운동 생성 작업(예: 이어짐, 보간, 초기 자세 기반 생성 등)에서 일반화 능력과 성능을 향상시키기 위해 다중 제어 조건에서의 공동 학습이 유의미한 영향을 미치는지 입증하기 위해.
  • 학습 시간과 파라미터 업데이트를 최소화하면서도 높은 품질의 출력을 유지할 수 있는 확장 가능하고 효율적인 운동 생성 방법을 확립하기 위해.

제안 방법

  • MotionGPT는 사전 학습된 VQ-VAE를 사용해 인간 운동 시퀀스를 이산 코드로 정량화하여 자세 시퀀스를 토큰 시퀀스로 표현할 수 있도록 합니다.
  • 텍스트와 자세 코드와 같은 다중 모달 입력을 통합된 지시 프롬프트로 구성하며, 이를 LLM의 특수 입력 토큰으로 간주합니다.
  • LoRA(Low-Rank Adaptation)를 활용해 LLM의 총 파라미터 중 0.4%만을 미세조정함으로써 사전 학습된 모델의 운동 사전 지식을 유지하면서도 운동 생성에 적합하게 조정합니다.
  • 모델은 텍스트 지시와 초기 또는 중간 자세 프레임에 조건화된 운동 시퀀스를 예측하도록 종단 간(end-to-end)으로 학습됩니다.
  • 다양한 작업(예: 운동 이어짐, 보간, 초기 자세 기반 생성 등)을 처리할 수 있도록 통합된 지시 미세조정 프레임워크를 설계합니다.
  • LLM의 자동회귀성과 가변 길이 출력 생성 능력을 활용해 다양한 길이의 운동 생성을 유연하게 지원합니다.

실험 결과

연구 질문

  • RQ1단일의 통합 LLM 기반 모델이 텍스트와 단일 프레임 자세 입력에 모두 기반해 인간 운동 시퀀스를 효과적으로 생성할 수 있는가?
  • RQ2텍스트와 자세와 같은 다중 제어 모달에서의 공동 학습이 개별 모달에서의 학습보다 성능을 향상시키는가?
  • RQ3최소한의 파라미터 업데이트와 낮은 학습 비용으로 사전 학습된 LLM을 운동 생성에 효과적으로 적응시킬 수 있는가?
  • RQ4LoRA의 하이퍼파라미터(즉, r 및 α)의 선택이 운동 생성 품질과 학습 효율성에 어떤 영향을 미치는가?
  • RQ5이러한 작업들(예: 이어짐, 보간, 자세 기반 생성 등)에 걸쳐 모델이 얼마나 잘 일반화되는가?

주요 결과

  • MotionGPT는 7B 파라미터 모델을 사용해 HumanML3D 및 KIT-ML 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, FID는 0.590, MM Dist는 3.796을 기록했습니다.
  • 텍스트와 자세의 다중 제어 조건에서의 공동 학습은 별도 학습 대비 모든 지표에서 성능 향상을 크게 이끌어내었으며, FID는 0.180 감소하고 MM Dist는 0.471 감소했습니다.
  • 모델는 총 파라미터의 0.4%에 해당하는 33M개의 학습 가능한 파라미터만을 사용해도 뛰어난 성능을 달성하였으며, 학습 시간은 약 4시간으로 이전 방법의 10%에 불과했습니다.
  • α/r 비율을 유지하면서 LoRA 랭크(r)를 증가시키면 성능 향상이 이루어지며, 최적의 결과는 α=16, r=16 이상에서 달성되었습니다.
  • 모델는 강력한 일반화 능력을 보이며, 운동 이어짐, 보간, 자세 조건 기반 생성 등의 작업에서 고다양성과 고정밀도의 운동 시퀀스를 생성했습니다.
  • 프롬프트에 关건 자세 토큰(예: 초기 및 최종 자세)을 포함시킬 경우, 별도 학습 대비 R-Precision가 0.045 증가하고 다양성은 0.647 증가했습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.