Skip to main content
QUICK REVIEW

[論文レビュー] TM2T: Stochastic and Tokenized Modeling for the Reciprocal Generation of 3D Human Motions and Texts

Chuan Guo, Xinxin Xuo|arXiv (Cornell University)|Jul 4, 2022
Human Pose and Action Recognition被引用数 7
ひとこと要約

本稿では、3次元人体運動とテキスト間の双方向的生成を可能にする確率的でトークン化されたフレームワーク、TM2Tを提案する。運動トークン(3次元ポーズの離散的かつコン act な表現)を導入し、ニューラル機械翻訳(NMT)と逆方向アライメントを組み合わせることで、テキストからの多様で意味的に忠実で長さが可変な運動生成を実現し、テキスト2運動および運動2テキストの両タスクにおいて2つのベンチマークデータセットで最先端の性能を達成した。

ABSTRACT

Inspired by the strong ties between vision and language, the two intimate human sensing and communication modalities, our paper aims to explore the generation of 3D human full-body motions from texts, as well as its reciprocal task, shorthanded for text2motion and motion2text, respectively. To tackle the existing challenges, especially to enable the generation of multiple distinct motions from the same text, and to avoid the undesirable production of trivial motionless pose sequences, we propose the use of motion token, a discrete and compact motion representation. This provides one level playing ground when considering both motions and text signals, as the motion and text tokens, respectively. Moreover, our motion2text module is integrated into the inverse alignment process of our text2motion training pipeline, where a significant deviation of synthesized text from the input text would be penalized by a large training loss; empirically this is shown to effectively improve performance. Finally, the mappings in-between the two modalities of motions and texts are facilitated by adapting the neural model for machine translation (NMT) to our context. This autoregressive modeling of the distribution over discrete motion tokens further enables non-deterministic production of pose sequences, of variable lengths, from an input text. Our approach is flexible, could be used for both text2motion and motion2text tasks. Empirical evaluations on two benchmark datasets demonstrate the superior performance of our approach on both tasks over a variety of state-of-the-art methods. Project page: https://ericguo5513.github.io/TM2T/

研究の動機と目的

  • テキストからの決定的で静的、あるいは多様性に欠ける3次元運動生成の限界、特にスタイルや長さの変化の欠如を是正すること。
  • 自然言語と3次元人体運動の間で双方向の生成を可能とし、テキスト2運動および運動2テキストの両タスクをサポートすること。
  • 元の3次元ポーズ列の冗長性と表現力の低さを克服するため、コンパクトで意味的に豊かな運動トークン表現を導入すること。
  • 逆方向アライメントを介して運動2テキストモジュールをトレーニングパイプラインに統合することで、テキスト2運動生成の性能と意味的忠実性を向上させること。

提案手法

  • 3次元ポーズ列の深層ベクトル量子化により運動トークンが学習され、運動がコードブックインデックスの離散的系列として表現される。
  • ニューラル機械翻訳(NMT)モデルが、運動トークン系列とテキストトークン系列の間の双方向マッピングを学習するために適応される。
  • テキスト2運動のトレーニングパイプラインには、運動2テキストモジュールが逆方向アライメント損失として組み込まれており、生成された運動と入力テキストとの乖離をペナルティ処理する。
  • 学習された運動トークン上の確率分布からのサンプリングにより、非決定的生成が可能となり、長さが可変で多様な運動出力を得られる。
  • 両タスク間で一貫性と柔軟性を保つために、テキスト2運動および運動2テキストの両方で共通のNMTアーキテクチャが使用される。
  • 運動トークンのコードブックは、局所的な空間的・時間的運動ダイナミクスを捉えるために、全身の3次元ポーズ列で学習される。

実験結果

リサーチクエスチョン

  • RQ1離散的でコンパクトな運動表現は、テキストからの3次元運動生成の多様性と品質を向上させることができるか?
  • RQ2逆方向アライメントを介して運動2テキストモジュールをテキスト2運動のトレーニングプロセスに統合した場合、意味的忠実性と性能にどのような影響を与えるか?
  • RQ3共通のNMTベースのアーキテクチャが、3次元人体運動と自然言語の間で高品質な双方向生成をどの程度可能にするか?
  • RQ4運動トークンは、局所的運動ダイナミクスを効果的にモデル化しつつ、非決定的かつ長さが可変な運動生成を可能にするか?
  • RQ5本手法は、決定的で学習されていない運動表現ベースラインと比較して、多様性および意味的正確性の面でどの程度優れているか?

主な発見

  • 提案されたTM2Tフレームワークは、2つのベンチマークデータセットにおいて、テキスト2運動および運動2テキストの両タスクで最先端の性能を達成し、既存手法を上回った。
  • 逆方向アライメント戦略により、HumanML3Dデータセットにおいてトップ1およびトップ3のリtrieval精度がそれぞれ約7%および10%向上した。
  • 同じテキスト入力から、多様で視覚的に妥当な長さ可変の3次元運動が生成され、静的または単純なポーズ系列を回避した。
  • 運動トークンは3次元ポーズを効率的に圧縮しつつ、意味的および動的コンテンツを保持でき、効率的なNMTベースのクロスモodalマッピングを可能にした。
  • NVIDIA 2080Ti上で300の運動を生成する際の推論時間は9秒であり、Text2Gesture(250秒)やHier(39秒)といった遅いベースラインを上回った。
  • 視覚的比較では、TM2Tが、例えば「右足」や「頭の上を越えて」などの意味的詳細を、決定的ベースライン(例:Hier [11])よりもよく捉えた運動を生成していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。