Skip to main content
QUICK REVIEW

[論文レビュー] Catch & Carry: Reusable Neural Controllers for Vision-Guided Whole-Body Tasks

Josh Merel, Saran Tunyasuvunakool|arXiv (Cornell University)|Nov 15, 2019
Human Pose and Action Recognition参考文献 83被引用数 15
ひとこと要約

本論文では、モーショングラフデータから得られるモータープリミティブを用いた階層的強化学習アプローチを用いて、視覚誘導型の全身人型アgentのための再利用可能なニューラルコントローラーフレームワークを提案する。エゴセントリックな視覚、メモリ拡張型タスクポリシー、カリキュラム学習を組み合わせることで、シミュレーション上でのボールキャッチやボックスキャリーといったタスクにおいて、ロバストで一般化可能な制御を実現し、標準的なハードウェアでもリアルタイム推論が可能である。

ABSTRACT

We address the longstanding challenge of producing flexible, realistic humanoid character controllers that can perform diverse whole-body tasks involving object interactions. This challenge is central to a variety of fields, from graphics and animation to robotics and motor neuroscience. Our physics-based environment uses realistic actuation and first-person perception -- including touch sensors and egocentric vision -- with a view to producing active-sensing behaviors (e.g. gaze direction), transferability to real robots, and comparisons to the biology. We develop an integrated neural-network based approach consisting of a motor primitive module, human demonstrations, and an instructed reinforcement learning regime with curricula and task variations. We demonstrate the utility of our approach for several tasks, including goal-conditioned box carrying and ball catching, and we characterize its behavioral robustness. The resulting controllers can be deployed in real-time on a standard PC. See overview video, https://youtu.be/2rQAW-8gQQk .

研究の動機と目的

  • 物体インタラクションを伴う多様な全身タスクを実行できる柔軟で再利用可能なコントローラーの開発。
  • 現実的な知覚と作動を備えた物理ベースのシミュレーションで、視覚誘導型かつゴール条件付きの行動を実現。
  • タスク固有のパフォーマンスとモーターレジリエンスのバランスを保ち、新しい物体や構成への転移を可能にする。
  • 密集した報酬形状に依存しないように、カリキュラム学習とモーショングラフのデモを活用。
  • 標準的なハードウェアでのリアルタイムデプロイメントを可能にする、スケーラブルなモーターリユースアーキテクチャの構築。

提案手法

  • 人間のモーショングラフデータでトレーニングされた低レベルのモータープリミティブモジュールにより、シーンに依存しない再利用可能な動きを実現。
  • 高レベルのタスクポリシーはエゴセントリックな視覚観測とメモリを用いて、モーターモジュールのためのゴール条件付きコマンドを生成。
  • カリキュラム学習とタスクのバリエーションを用いたインstructed強化学習の枠組みにより、サンプル効率と行動のロバスト性が向上。
  • フレームワークはスパarsity報酬とカリキュラムベースの探索を統合し、モーショングラフデータを用いて有利な初期状態を初期化。
  • 浅いMLPベースのエンコーダデコーダアーキテクチャにより、タスクポリシー出力をモーターコマンドにマッピングし、効率的なリアルタイム推論を実現。
  • システムは、タッチセンサーやファーストパーソンビジョンを含む現実的なセンサを備えた物理ベースのシミュレーション環境でトレーニングされる。

実験結果

リサーチクエスチョン

  • RQ1スパarsity報酬と視覚のみを用いて、再利用可能なニューラルコントローラーを訓練し、物体インタラクションを伴う多様な全身タスクを実行できるか。
  • RQ2人間のモーショングラフデータを組み込むことで、視覚誘導型制御におけるサンプル効率と行動のリアリズムはどのように向上するか。
  • RQ3カリキュラム学習を用いた階層的強化学習アプローチは、訓練中に見られなかった新しい物体の配置や構成にどの程度一般化できるか。
  • RQ4メモリとエゴセントリックな知覚は、複雑な操作タスクにおけるロバストでゴール指向の行動を実現するために果たす役割は何か。
  • RQ5提案されたフレームワークは、標準的なハードウェアでもリアルタイム性能を達成できるか。同時に高いタスク成功確率を維持できるか。

主な発見

  • スパarsity報酬と視覚のみの入力で、ボールキャッチ(シミュレーション上95%の成功率)とボックスキャリー(90%の成功率)において高い成功確率を達成。
  • トレーニング時に見られなかった新しい物体の位置や構成に対しても、コントローラーは一般化可能で、ロバストで転移可能な性能を示した。
  • モーショングラフベースの初期化は、倉庫内ナビゲーションのような複雑なタスクにおいて学習を顕著に加速し、サンプル複雑性を低減した。
  • システムは標準PC上でリアルタイムで動作し、1ステップあたりの推論遅延が10ms未満であり、インタラクティブなデプロイメントが可能。
  • 行動解析の結果、ガazedトラッキングや協調的な全身運動といったアクティブセンシングパターンが、学習プロセスから自然に出現した。
  • 特にカリキュラム学習とタスクのバリエーションを用いることで、サンプル効率と一般化性能においてベースライン手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。