Skip to main content
QUICK REVIEW

[論文レビュー] Model-based Reinforcement Learning with Parametrized Physical Models and Optimism-Driven Exploration

Christopher Xie, Sachin Patil|arXiv (Cornell University)|Sep 23, 2015
Reinforcement Learning in Robotics参考文献 14被引用数 3
ひとこと要約

本論文では、パラメータ化された物理的ダイナミクスモデルと、モデル予測制御(MPC)を用いた楽観的探索を組み合わせたモデルベース強化学習手法を提案する。形状由来の特徴量を用いて高速な最小二乗法によるダイナミクス同定を実現し、目的指向の探索を楽観的MPCで行うことで、ベンチマークとしてのロボットタスク(7自由度アームを含む)において、最先端のサンプル効率とリアルタイム性能を達成した。

ABSTRACT

In this paper, we present a robotic model-based reinforcement learning method that combines ideas from model identification and model predictive control. We use a feature-based representation of the dynamics that allows the dynamics model to be fitted with a simple least squares procedure, and the features are identified from a high-level specification of the robot's morphology, consisting of the number and connectivity structure of its links. Model predictive control is then used to choose the actions under an optimistic model of the dynamics, which produces an efficient and goal-directed exploration strategy. We present real time experimental results on standard benchmark problems involving the pendulum, cartpole, and double pendulum systems. Experiments indicate that our method is able to learn a range of benchmark tasks substantially faster than the previous best methods. To evaluate our approach on a realistic robotic control task, we also demonstrate real time control of a simulated 7 degree of freedom arm.

研究の動機と目的

  • ロボットの形状に関するドメイン知識をダイナミクスモデリングに統合することで、モデルベース強化学習における学習の高速化を図ること。
  • 連続制御タスクにおいて多数の相互作用サンプルを必要とする一般化された統計モデルの非効率性を解消すること。
  • モデル同定と探索における計算オーバーヘッドを低減することで、高次元ロボットにおけるリアルタイムのオンライン学習を可能にすること。
  • 高速な最小二乗法によるダイナミクス適合と楽観的探索を組み合わせた手法を提案し、効率的なタスク実行を実現すること。
  • 7自由度アームのような複雑で高次元のロボットシステムにおいて、シミュレーション環境でその適用可能性を示すこと。

提案手法

  • ロボットの形状(リンクの数と接続関係)から得られる特徴量に基づく線形ダイナミクスモデルを用い、高速な最小二乗法によるフィッティングを可能にする。
  • 不確実性に対する楽観的態度をとったMPCを用いて、目的指向の軌道へ向かう探索を誘導する。
  • より多くの相互作用データが得られるにつれて楽観的態度を徐々に減衰させることで、真のダイナミクスへの収束を可能にする。
  • SymPyBoticsなどのツールを用いてロボット構造から自動的にダイナミクス特徴量を生成し、手動による特徴量設計を回避する。
  • 状態遷移を学習済み特徴量の線形結合として表現するパラメータ化されたダイナミクスモデルを採用する。
  • オンラインでのモデル同定とMPCベースの制御を統合し、タスク実行中のリアルタイムな適応を可能にする。

実験結果

リサーチクエスチョン

  • RQ1物理的事前知識をダイナミクスモデリングに組み込むことで、ロボット制御のモデルベース強化学習におけるサンプル複雑性を顕著に低減できるか?
  • RQ2MPCを用いた楽観的探索を、高次元ロボットにおけるリアルタイムのオンライン学習に十分な計算効率で実現できるか?
  • RQ3標準ベンチマークにおいて、先行するモデルベース強化学習手法と比較して、本手法のサンプル効率と計算時間はどのように異なるか?
  • RQ4未知のダイナミクスを有する複雑で高自由度のロボットシステム(例:7自由度アーム)に対しても本手法は汎用性を示せるか?
  • RQ5本手法は、モデル化されていないダイナミクスや現実世界の摂動に対して、どの程度のロバストネスを示すか?

主な発見

  • パーカッション、カートポール、ダブルペンダムのベンチマークにおいて、すべての比較手法と比較して最も短い相互作用時間を達成し、優れたサンプル効率を示した。
  • 7自由度アームタスクでは、10回の試行すべてで目標ポーズに到達し、知られているダイナミクスを持つDDPと比較して、相互作用時間は2〜3倍程度にとどまった。
  • 各制御ステップにおける計算時間は相互作用時間と同等であり、オンライン学習に向けたリアルタイム実現可能性が裏付けられた。
  • 7自由度アームのダイナミクスモデルは70パラメータを有しており、ベンチマーク(<10パラメータ)と比較してはるかに複雑であったが、依然として高い効率性を維持した。
  • 先行するMPCベースの楽観的手法[21]と比較して、本手法はサンプル効率と計算速度の両面で優れており、リアルタイムでのデプロイが可能であった。
  • 形状に基づく特徴量の使用により、高次元システムであっても、広範なデータ収集の必要性が低下することが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。