Skip to main content
QUICK REVIEW

[논문 리뷰] TEMOS: Generating diverse human motions from textual descriptions

Mathis Petrovich, Michael J. Black|arXiv (Cornell University)|2022. 04. 25.
Human Pose and Action Recognition인용 수 13
한 줄 요약

TEMOS는 자연어 설명에서 다양한 3D 인간 운동 시퀀스를 생성하기 위해 복합 모odal 트랜스포머 아키텍처를 사용하는 변분 오토인코더 기반 텍스트-운동 생성 모델을 제안한다. 텍스트에 조건부로 학습된 잠재 공간에서 샘플링을 통해 각 설명에 대해 다수의 타당한 운동을 생성하며, KIT Motion-Language 벤치마크에서 정량적 지표와 인간 평가 모두에서 최신 기술 수준을 확보한다.

ABSTRACT

We address the problem of generating diverse 3D human motions from textual descriptions. This challenging task requires joint modeling of both modalities: understanding and extracting useful human-centric information from the text, and then generating plausible and realistic sequences of human poses. In contrast to most previous work which focuses on generating a single, deterministic, motion from a textual description, we design a variational approach that can produce multiple diverse human motions. We propose TEMOS, a text-conditioned generative model leveraging variational autoencoder (VAE) training with human motion data, in combination with a text encoder that produces distribution parameters compatible with the VAE latent space. We show the TEMOS framework can produce both skeleton-based animations as in prior work, as well more expressive SMPL body motions. We evaluate our approach on the KIT Motion-Language benchmark and, despite being relatively straightforward, demonstrate significant improvements over the state of the art. Code and models are available on our webpage.

연구 동기 및 목표

  • 자연어 설명에서 모호하고 다수의 해석이 가능한 경우가 많은 3D 인간 운동 시퀀스를 다양하고 현실적으로 생성하는 데 도전한다.
  • 이전 방법이 텍스트 입력당 단일 결정론적 운동을 생성하는 데 한계가 있음을 고려해, 운동을 단일 시퀀스가 아니라 분포로 모델링함으로써 이를 해결한다.
  • 자기회귀적 디코딩과 그로 인한 시간에 따른 누적 오류 및 왜곡을 피하는 순서 수준의 생성 모델을 개발한다.
  • 동일한 텍스트 조건 프레임워크에서 뼈대 기반 및 SMPL 기반의 전체 몸체 메쉬 운동을 생성할 수 있도록 한다.
  • 표준 지표가 확률적 운동 생성에 한계가 있음을 고려해, 정량적 평가 외에도 인간의 인지 평가를 통한 평가를 수행한다.

제안 방법

  • 운동 생성이 텍스트 인코더에 의해 파arameter화된 분포에서 샘플링된 잠재 벡터에 조건부로 이루어지는 변분 오토인코더(VAE) 프레임워크를 사용한다.
  • 텍스트와 운동 시퀀스는 별도의 트랜스포머 인코더를 통해 처리되며, 이를 통해 공유된 복합 모달 잠재 공간으로 투영된다.
  • 운동 디코더는 위치 인코딩과 단일 잠재 벡터를 사용하는 트랜스포머 아키텍처를 활용하여 한 번의 순방향 전파로 전체 3D 운동 시퀀스를 생성함으로써 자기회귀적 생성을 회피한다.
  • 모델은 텍스트 인코더가 VAE의 잠재 분포에 대한 평균과 로그 분산을 생성하도록 KIT Motion-Language 데이터셋에서 엔드 투 엔드로 훈련된다.
  • 이 프레임워크는 뼈대 관절 시퀀스와 SMPL 신체 메쉬 시퀀스 모두의 생성을 지원하여 더 표현력 있는 운동 합성 가능하다.
  • 모델은 다양한 설정에서 평가되며, 실제 첫 번째 프레임이 없는 상태에서의 전체 운동 생성(초기 조건 없음)과 아울러 아키텍처의 핵심 구성 요소를 분리해 분석하는 아블레이션 스터디가 수행된다.

실험 결과

연구 질문

  • RQ1순서 수준의 비자기회귀적 생성 모델은 자연어 설명에서 다양한 3D 인간 운동을 생성할 수 있는가?
  • RQ2공유된 복합 모달 잠재 공간을 사용하는 VAE 기반 접근법은 자기회귀적 모델 대비 운동의 다양성과 품질에서 어떻게 비교되는가?
  • RQ3전체 시퀀스 생성에 단일 잠재 벡터를 사용할 경우 자기회귀적 디코딩 대비 성능 향상은 어느 정도 이루어지는가?
  • RQ4첫 번째 진짜 프레임을 조건으로 하지 않고 전체 운동을 생성할 경우 모델의 성능은 어떻게 되는가?
  • RQ5텍스트 인코더를 미세조정하면 모델 성능에 어떤 영향을 미치며, 고정해두는 것이 더 좋은 결과를 낳는가?

주요 결과

  • TEMOS는 KIT Motion-Language 벤치마크에서 정량적 지표와 인간 인지 평가 모두에서 이전 연구를 능가하는 최신 기술 수준의 성능을 달성한다.
  • 모델은 각 텍스트 입력당 다양한 타당한 운동 시퀀스를 생성하여, 모호한 언어 설명에 내재된 자유도를 효과적으로 탐색한다.
  • 아블레이션 스터디 결과, 이전 연구 대비 주요 향상 요인은 자기회귀적 디코딩이 아닌 단일 잠재 벡터를 사용한 비자기회귀적 순서 수준의 생성 방식에 기인한다.
  • 이전 방법 대비 위치 오차와 분산 오차를 크게 감소시켰으며, 언어 모델을 고정한 경우 루트 관절의 평균 위치 오차가 0.963, 전역 궤적의 평균 위치 오차가 0.955로 나타났다.
  • 텍스트 모델의 파라미터를 미세조정해도 성능 향상이 없었으며, 이는 이 작업에서 텍스트 인코더를 고정하는 것이 더 우수한 일반화 성능을 제공한다는 것을 시사한다.
  • 정성적 결과는 모델이 텍스트 설명을 존중하면서도 액션이 모호한 경우에도 다양한 SMPL 기반 신체 운동을 생성할 수 있음을 보여주며, 영상 예시에서 명확한 시각적 다양성이 관찰된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.