[논문 리뷰] TM2T: Stochastic and Tokenized Modeling for the Reciprocal Generation of 3D Human Motions and Texts
이 논문은 3D 인간 동작과 텍스트 간 이방향 생성을 위한 확률적이고 토큰 기반 프레임워크인 TM2T를 제안한다. 운동 토큰—3D 자세의 이산적이고 압축된 표현 방식—을 도입하고, 신경 기계 번역(NMT) 및 역방향 정렬을 결합함으로써, 텍스트에서 다양하고 의미적으로 충실하며 길이가 가변적인 운동 생성이 가능해지며, 두 개의 벤치마크 데이터셋에서 텍스트2운동 및 운동2텍스트 작업 모두에서 최고 성능을 달성한다.
Inspired by the strong ties between vision and language, the two intimate human sensing and communication modalities, our paper aims to explore the generation of 3D human full-body motions from texts, as well as its reciprocal task, shorthanded for text2motion and motion2text, respectively. To tackle the existing challenges, especially to enable the generation of multiple distinct motions from the same text, and to avoid the undesirable production of trivial motionless pose sequences, we propose the use of motion token, a discrete and compact motion representation. This provides one level playing ground when considering both motions and text signals, as the motion and text tokens, respectively. Moreover, our motion2text module is integrated into the inverse alignment process of our text2motion training pipeline, where a significant deviation of synthesized text from the input text would be penalized by a large training loss; empirically this is shown to effectively improve performance. Finally, the mappings in-between the two modalities of motions and texts are facilitated by adapting the neural model for machine translation (NMT) to our context. This autoregressive modeling of the distribution over discrete motion tokens further enables non-deterministic production of pose sequences, of variable lengths, from an input text. Our approach is flexible, could be used for both text2motion and motion2text tasks. Empirical evaluations on two benchmark datasets demonstrate the superior performance of our approach on both tasks over a variety of state-of-the-art methods. Project page: https://ericguo5513.github.io/TM2T/
연구 동기 및 목표
- 텍스트에서 3D 운동을 생성할 때 발생하는 결정론적, 정적, 또는 다양성이 낮은 제약을 해결하기 위해, 특히 스타일과 길이의 다양성이 부족한 점을 보완한다.
- 3D 인간 운동과 자연어 간 상호 작용 가능한 생성을 가능하게 하여, 텍스트2운동 및 운동2텍스트 작업을 모두 지원한다.
- 원시적인 3D 자세 시퀀스의 부족한 표현력과 중복 문제를 해결하기 위해, 압축되고 의미적으로 풍부한 운동 토큰 표현 방식을 도입한다.
- 역방향 정렬을 통해 운동2텍스트 모듈을 학습 파이프라인에 통합함으로써 텍스트2운동 생성의 정확도를 향상시키고 의미적 충실도를 높인다.
제안 방법
- 3D 자세 시퀀스의 딥 벡터 양자화를 통해 운동 토큰을 학습하여, 운동을 코드북 인덱스의 이산적 시퀀스로 표현한다.
- 신경 기계 번역(NMT) 모델을 변형하여 운동 토큰 시퀀스와 텍스트 토큰 시퀀스 간의 이방향 매핑을 학습한다.
- 텍스트2운동 학습 파이프라인은 역방향 정렬 손실로써 운동2텍스트 모듈을 포함하여, 생성된 운동과 입력 텍스트 간의 편차를 방지한다.
- 학습된 운동 토큰에 대한 분포에서 샘플링을 통해 비결정론적 생성을 가능하게 하여, 길이가 가변적이고 다양한 운동 출력을 생성한다.
- 텍스트2운동 및 운동2텍스트 작업 모두에 동일한 NMT 아키텍처를 사용하여, 작업 간 일관성과 유연성을 확보한다.
- 전신 3D 자세 시퀀스를 기반으로 한 코드북이 운동 토큰을 학습하여 국소적인 공간-시간 운동 동역학을 포착한다.
실험 결과
연구 질문
- RQ1이산적이고 압축된 운동 표현 방식이 텍스트에서 3D 운동 생성의 다양성과 품질을 향상시키는 데 효과적인가?
- RQ2역방향 정렬을 통해 운동2텍스트 모듈을 텍스트2운동 학습 과정에 통합할 경우 의미적 충실도와 성능에 어떤 영향을 미치는가?
- RQ3공유된 NMT 기반 아키텍처가 3D 인간 운동과 자연어 간 고품질의 이방향 생성을 얼마나 잘 수행할 수 있는가?
- RQ4운동 토큰이 국소 운동 동역학을 효과적으로 모델링하면서도 비결정론적이고 길이가 가변적인 운동 생성을 가능하게 할 수 있는가?
- RQ5이러한 방법이 결정론적 또는 학습되지 않은 운동 표현 기반 베이스라인 대비 다양성과 의미 정확도 측면에서 어떻게 비교되는가?
주요 결과
- 제안된 TM2T 프레임워크는 두 개의 벤치마크 데이터셋에서 텍스트2운동 및 운동2텍스트 작업 모두에서 기존 방법들을 능가하는 최고 수준의 성능을 달성한다.
- HumanML3D 데이터셋에서 역방향 정렬 전략은 상위 1위 검색 정밀도를 약 7% 향상시키고, 상위 3위 검색 정밀도는 약 10% 향상시켰다.
- 동일한 텍스트 입력에서 다양하고 시각적으로 타당한 길이가 가변적인 3D 운동을 생성하여 정적 또는 단순한 자세 시퀀스를 피한다.
- 운동 토큰은 3D 자세를 효율적으로 압축하면서도 의미적 및 운동적 내용을 유지하여, NMT 기반의 다중모달 매핑을 가능하게 한다.
- NVIDIA 2080Ti에서 300개의 운동을 생성하는 데 소요되는 추론 시간은 9초로, Text2Gesture(250초) 및 Hier(39초)와 같은 느린 베이스라인을 뛰어넘는다.
- 시각적 비교 결과, TM2T는 결정론적 베이스라인인 Hier [11]보다 의미적 세부 정보(예: "오른쪽 다리", "머리 위로")를 더 잘 포착한 운동을 생성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.