Skip to main content
QUICK REVIEW

[論文レビュー] MoCapAct: A Multi-Task Dataset for Simulated Humanoid Control

Nolan Wagener, Andrey Kolobov|arXiv (Cornell University)|Aug 15, 2022
Human Pose and Action Recognition被引用数 4
ひとこと要約

MoCapActは、dm_control humanoid環境における3.5時間にわたるモーショントラッキングデータを追跡するエキスパートポリシーを含む大規模かつ高品質なデータセットを提供し、複雑な歩行行動やモーショングレースの学習を効率的に行うことを可能にする。このデータセットにより、階層的ポリシーおよび自己回帰的GPTモデルの学習が可能となり、モーショングレースのプロンプトから自然で長時間にわたる動きを生成する。

ABSTRACT

Simulated humanoids are an appealing research domain due to their physical capabilities. Nonetheless, they are also challenging to control, as a policy must drive an unstable, discontinuous, and high-dimensional physical system. One widely studied approach is to utilize motion capture (MoCap) data to teach the humanoid agent low-level skills (e.g., standing, walking, and running) that can then be re-used to synthesize high-level behaviors. However, even with MoCap data, controlling simulated humanoids remains very hard, as MoCap data offers only kinematic information. Finding physical control inputs to realize the demonstrated motions requires computationally intensive methods like reinforcement learning. Thus, despite the publicly available MoCap data, its utility has been limited to institutions with large-scale compute. In this work, we dramatically lower the barrier for productive research on this topic by training and releasing high-quality agents that can track over three hours of MoCap data for a simulated humanoid in the dm_control physics-based environment. We release MoCapAct (Motion Capture with Actions), a dataset of these expert agents and their rollouts, which contain proprioceptive observations and actions. We demonstrate the utility of MoCapAct by using it to train a single hierarchical policy capable of tracking the entire MoCap dataset within dm_control and show the learned low-level component can be re-used to efficiently learn downstream high-level tasks. Finally, we use MoCapAct to train an autoregressive GPT model and show that it can control a simulated humanoid to perform natural motion completion given a motion prompt. Videos of the results and links to the code and dataset are available at https://microsoft.github.io/MoCapAct.

研究の動機と目的

  • モーショントラッキングのための事前学習済みエキスパートポリシーを提供することで、シミュレーテッドヒューマノイド制御分野における研究の入り口を低くする。
  • モーショントラッキングデータから学習された低レベルスキルを再利用することで、高レベル行動の効率的学習を可能にする。
  • MoCapActのロールアウトを用いてGPTベースのポリシーを学習させることで、生成的モーショングレースを実現する。
  • 高品質なモーショントラッキングポリシーとロールアウトを広く研究利用可能な形で公開する。
  • 強化学習を用いたマルチクリップポリシーおよび下流タスクへの応用を通じて、このデータセットの有効性を実証する。

提案手法

  • dm_control環境において、個々のモーショントラッキングクリップを追跡するためのディープ強化学習エージェントを訓練し、各クリップ用のエキスパートポリシーを生成する。
  • 各エキスパートポリシーからノイズを含むロールアウト(観測値と行動)を収集し、MoCapActデータセットを構築する。
  • 共通の低レベルコンponentを有するMoCapActロールアウトを用いて、同時にすべてのクリップを追跡する階層的ポリシーを訓練する。
  • 下流タスクに対する強化学習を用いて、階層的ポリシーの低レベルコンponentをファインチューニングし、迅速な適応を可能にする。
  • 32ステップの観測値とエキスパート行動のシーケンスを用いて自己回帰的GPTモデルを学習し、モーショングレースプロンプトからの動き生成を実現する。
  • ロールアウト生成によるGPTポリシーの評価を行い、主成分分析(PCA)の投影を用いてエピソード長と動きの類似度を測定する。

実験結果

リサーチクエスチョン

  • RQ1共通の低レベルポリシー・コンponentを用いて、1つの階層的ポリシーが複数のモーショントラッキングクリップを同時に追跡できるか?
  • RQ2MoCapActから学習した低レベルポリシーは、強化学習を用いて新たな下流タスクに効果的にファインチューニング可能か?
  • RQ3GPTベースのモデルは、MoCapActデータを用いて短いモーショングレースプロンプトから長時間にわたる自然なヒューマノイドの動きを生成できるか?
  • RQ4GPTポリシーは未観測のクリップにどれほど一般化できるか?また、生成された動きの長さの分布はどのようになるか?
  • RQ5生成された動きは、元のモーショントラッキングクリップの運動学的パターンとどの程度一致するか?

主な発見

  • MoCapActデータセットには、dm_control環境において複数のクリップにわたる3.5時間にわたるモーショントラッキングデータを効果的に追跡するエキスパートポリシーが含まれている。
  • MoCapActロールアウトを用いて訓練された1つの階層的ポリシーは、すべての検討されたモーショントラッキングクリップを追跡でき、マルチクリップ一般化の有効性が示された。
  • 階層的ポリシーの低レベルコンponentは、強化学習を用いて迅速に新たな下流タスクを学習可能であることが確認された。
  • GPTベースのポリシーは、平均エピソード長5.47秒(プロンプト長の1.15倍)の自然な長時間にわたる動き生成を実現し、堅牢な長時間生成性能を示した。
  • PCAの投影結果から、GPTによって生成された行動はしばしば実際の動きを再現しているが、プロンプトの曖昧さのため、まれに逸脱が生じることが確認された。
  • GPTモデルは、歩行行動や非歩行行動を含む多様なクリップに一般化可能であり、トレーニングセットおよびホールドアウト検証セットの両方で一貫した性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。