Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical Policy Design for Sample-Efficient Learning of Robot Table Tennis Through Self-Play

Reza Mahjourian, Risto Miikkulainen|arXiv (Cornell University)|Nov 30, 2018
Reinforcement Learning in Robotics被引用数 9
ひとこと要約

本論文は、人間の模倣と自己対戦を用いて、サンプル効率的な訓練を可能にする階層的強化学習フレームワークを提案する。モデルフリーのポリシー学習による戦略、モデルベースのダイナミクス予測によるボールの物理現象、ロボットの運動学的制御のための解析的コントローラーを組み合わせることで、約24,000回の自己対戦と約7,000件の人の行動軌跡のみで、シミュレーションから実世界への転送を必要としない実世界での実装を可能にする。

ABSTRACT

Training robots with physical bodies requires developing new methods and action representations that allow the learning agents to explore the space of policies efficiently. This work studies sample-efficient learning of complex policies in the context of robot table tennis. It incorporates learning into a hierarchical control framework using a model-free strategy layer (which requires complex reasoning about opponents that is difficult to do in a model-based way), model-based prediction of external objects (which are difficult to control directly with analytic control methods, but governed by learnable and relatively simple laws of physics), and analytic controllers for the robot itself. Human demonstrations are used to train dynamics models, which together with the analytic controller allow any robot that is physically capable to play table tennis without training episodes. Using only about 7,000 demonstrated trajectories, a striking policy can hit ball targets with about 20 cm error. Self-play is used to train cooperative and adversarial strategies on top of model-based striking skills trained from human demonstrations. After only about 24,000 strikes in self-play the agent learns to best exploit the human dynamics models for longer cooperative games. Further experiments demonstrate that more flexible variants of the policy can discover new strikes not demonstrated by humans and achieve higher performance at the expense of lower sample-efficiency. Experiments are carried out in a virtual reality environment using sensory observations that are obtainable in the real world. The high sample-efficiency demonstrated in the evaluations show that the proposed method is suitable for learning directly on physical robots without transfer of models or policies from simulation. Supplementary material available at https://sites.google.com/view/robottabletennis

研究の動機と目的

  • データ収集が高価で並列化が困難な物理的環境において、複雑なロボットスキルのサンプル効率的な学習を可能にすること。
  • モデルフリー、モデルベース、解析的制御コンponentsを統合する階層的制御アーキテクチャを構築し、学習効率を向上させること。
  • 人間の模倣と自己対戦を活用することで、シミュレーションから実世界へのポリシー転送を必要としないテーブルテニスエージェントの実世界での実装を可能にすること。
  • 自己対戦を通じて、人間が学習していない新たな戦略を発見できるようにし、高いパフォーマンスと一般化能力を維持すること。
  • 人間が学習したボールのダイナミクスモデルと、戦略レベルでの効率的な強化学習を組み合わせることで、最小限の相互作用でロボットがテーブルテニスを学習できることを示すこと。

提案手法

  • 本手法は、三層構造の階層的ポリシーを採用する:相手の行動を推論するモデルフリーの戦略ポリシー、人間の模倣から学習したダイナミクスを用いたモデルベースのボールのダイナミクス予測器、およびロボットのパドル運動を制御する解析的コントローラー。
  • 人間の模倣軌跡(n ≈ 7,000)を正規化し、サブサンプリングして、さまざまなパドルストライク下でのボール軌道を予測するダイナミクスモデルを学習する。
  • 位置と速度のタイムスタンプ付きの運動ターゲットを高レベルのアクションとして用い、パドルの複雑な運動を効率的に学習可能な戦略ポリシーを実現する。
  • 解析的パドルコントローラーは、任意の互換性のあるロボットハードウェア上で与えられた運動ターゲットを実行可能であり、ロボット非依存のポリシー配備を可能にする。
  • 自己対戦を用いて戦略ポリシーを訓練し、協力的および敵対的なモードでエージェント同士が対戦することで、新たなゲーム戦略を発見する。
  • 強化学習は高レベルの戦略ポリシーにのみ適用され、探索の複雑さが低減され、サンプル効率が向上する。

実験結果

リサーチクエスチョン

  • RQ1少数の数百件の人の模倣によるデータのみを用いて、階層的ポリシー設計が複雑なロボットテーブルテニスポリシーのサンプル効率的な学習を可能にするか?
  • RQ2人間のデータから学習したモデルベースのボールダイナミクス予測が、直接的な物理的相互作用なしに、正確で一般化可能なストライク予測を可能にするか?
  • RQ3モデルベースのスキルポリシー上で自己対戦を実施することで、人間の模倣を超えた、新たな高パフォーマンスの協力的および敵対的戦略が発見可能か?
  • RQ4解析的コントローラーと学習済みのダイナミクスモデルの組み合わせにより、シミュレーションから実世界への転送を必要とせず、実機に直接デプロイ可能か?
  • RQ5階層的分解は、連続制御タスクにおける高レベルのロボット戦略の学習におけるサンプル複雑性をどの程度低減できるか?

主な発見

  • 本手法は、わずか約7,000件の人の模倣軌跡のみで、平均誤差が約20 cmのボールを打つポリシーを達成する。
  • 自己対戦による約24,000回のボールの交換後、エージェントは平均14~16回のラリーを継続可能な戦略ポリシーを学習する。
  • より柔軟なスキル(例:'hit-ball')を用いた訓練では、人間の行動とは異なる新たなストライクを発見し、模倣された動きを超えた、自己発生的な戦略的行動を示す。
  • 解析的コントローラーとダイナミクスモデルにより、追加のトレーニングなしに実機ハードウェア上で6~8回のヒットラリーを実現する。
  • 本システムは、最小限のデータで実機にデプロイ可能であり、シミュレーションから実世界への転送を回避できるほどサンプル効率的であることが示された。
  • 階層的設計により、強化学習の問題の複雑さが顕著に低減され、ハイパーパrameterチューニングを最小限に抑えつつ、迅速な収束が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。