Skip to main content
QUICK REVIEW

[論文レビュー] LAGOON: Language-Guided Motion Control

Shusheng Xu, Huaijie Wang|arXiv (Cornell University)|Jun 18, 2023
Human Pose and Action RecognitionComputer Science被引用数 3
ひとこと要約

LAGOONは、自然言語コマンドに応じて物理的に現実的なロボットの動きを生成するマルチフェーズフレームワークである。まず、動きの拡散モデル(MDM)を用いて人間の動きを生成し、次にシミュレーション上で強化学習(RL)ポリシーを訓練してその動きを模倣させ、最後にそのポリシーを実際の四足歩行型ロボットにデプロイする。本手法により、実際のロボットドッグが「ボールを投げる」という命令に対して立ち上がったり、前肢を振ったりする動作を成功裏に実行した。ドメインランダマイゼーションとハイブリッド報酬設計を用いることで、シミュレーションから実世界への転送が安定的に行われた。

ABSTRACT

We aim to control a robot to physically behave in the real world following any high-level language command like "cartwheel" or "kick". Although human motion datasets exist, this task remains particularly challenging since generative models can produce physically unrealistic motions, which will be more severe for robots due to different body structures and physical properties. Deploying such a motion to a physical robot can cause even greater difficulties due to the sim2real gap. We develop LAnguage-Guided mOtion cONtrol (LAGOON), a multi-phase reinforcement learning (RL) method to generate physically realistic robot motions under language commands. LAGOON first leverages a pretrained model to generate a human motion from a language command. Then an RL phase trains a control policy in simulation to mimic the generated human motion. Finally, with domain randomization, our learned policy can be deployed to a quadrupedal robot, leading to a quadrupedal robot that can take diverse behaviors in the real world under natural language commands

研究の動機と目的

  • 高レベルの自然言語コマンド(例:「カートゥーリング」や「キック」)に応じて、物理的に現実的なロボットの動きを実行できるようにすること。
  • 元の動きが合成的に生成されており、不自然なポーズや欠損フレームを含む場合に、物理的に妥当なロボットの動きを生成する課題に対処すること。
  • ドメインランダマイゼーションを用いてシミュレーションで制御ポリシーを訓練し、実際の四足歩行型ロボットにデプロイすることで、シミュレーションから実世界へのギャップを埋めること。
  • 敵対的報酬と状態誤差報酬を組み合わせた報酬設計を開発し、意味的整合性と詳細な動きの模倣の両方を確保すること。
  • 人間型と四足歩行型ロボットを含む多様なロボット形状に一般化できる、単一の統合パイプラインを構築すること。

提案手法

  • まず、事前学習済みの動きの拡散モデル(MDM)が、指定された言語コマンドから人間の動きを生成する。
  • 生成された人間の動きがロボットのスケルトンにリターゲティングされ、意味的に整合的だが物理的に現実的でないターゲット動きが作成される。
  • 物理シミュレータ内で、敵対的報酬と状態誤差報酬を組み合わせたハイブリッド報酬関数を用いて、ターゲット動きを模倣するように強化学習ポリシーを訓練する。
  • 報酬関数は、意味的類似性を評価するためのコーチネットワークと、重要なフレームで正確な整合性を強制する状態誤差成分を含む。
  • 訓練中にドメインランダマイゼーションを適用することで、耐障害性を向上させ、シミュレーションから実世界への転送を成功させる。
  • 最終的なポリシーは実際の四足歩行型ロボットにデプロイされ、物理的安定性と安全性を確保するため、上半身のリターゲティングのみが使用される。

実験結果

リサーチクエスチョン

  • RQ1物理的に現実的でない動きをターゲットとして用いる場合でも、言語条件付きの動きの拡散モデルがロボット制御のためのターゲット動きを効果的に生成できるか?
  • RQ2欠損フレームや不可能なポーズを含む、合成的で誤りのあるターゲット動きを模倣するように強化学習ポリシーをどのように訓練できるか?
  • RQ3模倣学習におけるロボット制御において、ハイレベルの意味的整合性と詳細な動きの忠実度を両立させる報酬設計は何か?
  • RQ4単一の統合パイプラインが、人間型と四足歩行型ロボットを含む多様なロボット形状に耐性のある制御ポリシーを生成できるか?
  • RQ5ドメインランダマイゼーションを用いてシミュレーションで訓練されたポリシーが、複雑な言語誘導行動を実行する実世界の四足歩行型ロボットに、どの程度成功裏にデプロイできるか?

主な発見

  • 四足歩行型ロボットが「人間がボールを投げる」という命令に対して、立ち上がったり、前肢を振ったりする動作を成功裏に実行した。これは、LAGOONポリシーの実世界でのデプロイを示している。
  • アブレーションスタディの結果、敵対的報酬と状態誤差報酬の両方が不可欠であることが判明した。両方を欠如させると、ロボットは正しく立ち上がれず、前肢を適切に動かせなかった。
  • ハイブリッド初期化戦略のおかげで、ロボットは伏せた姿勢から立ち上がることを学習できたが、この戦略なしでは不可能であった。
  • 本手法は複数のリターゲティング戦略に一般化可能であり、後ろ向きに歩行する(後肢のみで)動作や、腕を挙上しながら後ろ向きに走る動作なども実現できた。
  • 定量的評価では、人間型および四足歩行型ロボットの両方において、LAGOONがすべてのRLベースラインを上回る動き統計を達成した。
  • 実世界実験により、ドメインランダマイゼーションで訓練されたポリシーが、シミュレーションと現実のダイナミクスギャップが存在する中でも、安定的かつ物理的に現実的な動作を達成したことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。