Skip to main content
QUICK REVIEW

[論文レビュー] Using Deep Reinforcement Learning to Learn High-Level Policies on the ATRIAS Biped

Tianyu Li, Akshara Rai|arXiv (Cornell University)|Sep 28, 2018
Reinforcement Learning in Robotics参考文献 19被引用数 4
ひとこと要約

本論文は、ATRIAS二足歩行ロボットにおける歩行ポリシーの学習のための構造的ディープ強化学習アプローチを提案する。シミュレーション内で、ニューラルネットワークが手作業で設計されたヒューリスティック制御則を改善する。本手法は、ドメインランダム化を用いずに、直感的な制御則構造を維持し、シミュレーションからハードウェアへのドメインギャップを低減することで、80%の成功したハードウェアへの転送を達成した。これは、純粋なニューラルネットワークポリシーを著しく上回る結果である。

ABSTRACT

Learning controllers for bipedal robots is a challenging problem, often requiring expert knowledge and extensive tuning of parameters that vary in different situations. Recently, deep reinforcement learning has shown promise at automatically learning controllers for complex systems in simulation. This has been followed by a push towards learning controllers that can be transferred between simulation and hardware, primarily with the use of domain randomization. However, domain randomization can make the problem of finding stable controllers even more challenging, especially for underactuated bipedal robots. In this work, we explore whether policies learned in simulation can be transferred to hardware with the use of high-fidelity simulators and structured controllers. We learn a neural network policy which is a part of a more structured controller. While the neural network is learned in simulation, the rest of the controller stays fixed, and can be tuned by the expert as needed. We show that using this approach can greatly speed up the rate of learning in simulation, as well as enable transfer of policies between simulation and hardware. We present our results on an ATRIAS robot and explore the effect of action spaces and cost functions on the rate of transfer between simulation and hardware. Our results show that structured policies can indeed be learned in simulation and implemented on hardware successfully. This has several advantages, as the structure preserves the intuitive nature of the policy, and the neural network improves the performance of the hand-designed policy. In this way, we propose a way of using neural networks to improve expert designed controllers, while maintaining ease of understanding.

研究の動機と目的

  • 二足歩行ロボットのためのディープ強化学習ポリシーをシミュレーションから実世界のハードウェアに転送する課題に対処すること。
  • ドメインランダム化の制限を克服すること。ドメインランダム化は、アンダーアクチュエート系において学習を妨げ、性能を低下させることがある。
  • ニューラルネットワークを構造的でエキスパート設計の制御則フレームワーク内に埋め込むことで、転送性を向上させること。
  • ポリシー全体の再トレーニングなしに、人間による制御則のチューニングと適応を可能にすること。
  • 構造的ポリシーが、ハードウェアデプロイメント中にパフォーマンスを維持しながら、耐性と解釈可能性を向上させることを実証すること。

提案手法

  • 地面の高さの変動が存在するATRIASロボットの高精細シミュレーションで、ディープ強化学習ポリシーをトレーニングする。
  • ニューラルネットワークが基本的なヒューリスティック制御則に状態依存の調整(例:所望の高さ、ピッチ、ステップ位置)を予測する、構造的制御則を用いる。
  • コア制御則アーキテクチャを固定したまま、シミュレーションでのみニューラルネットワークポリシーをファインチューニングする。
  • 安定的で効率的な歩行を促進する報酬関数を用いて、Proximal Policy Optimization (PPO) を用いてニューラルネットワークポリシーをトレーニングする。
  • 高トルクを罰するコスト関数を用いて、トレーニング中に保守的で頑健な挙動を促進する。
  • トレーニング済みのポリシーを直接実際のATRIASロボットに適用し、転送成功率と頑健性を評価する。
Figure 1 : Our test platform is CMU’s ATRIAS robot in a planar setup.
Figure 1 : Our test platform is CMU’s ATRIAS robot in a planar setup.

実験結果

リサーチクエスチョン

  • RQ1ドメインランダム化を用いずに、シミュレーションでトレーニングされたニューラルネットワークポリシーをハードウェアに成功裏に転送できるか?
  • RQ2ハイブリッドニューラル-ヒューリスティック制御則の構造は、純粋なニューラルネットワークポリシーと比較して、転送性能にどのように影響するか?
  • RQ3アクションスペースとコスト関数は、シミュレーションからハードウェアへの一般化をどのように向上させるか?
  • RQ4再トレーニングなしに、エキスパートの知識を学習済みポリシーに保存・変更できるか?
  • RQ5シミュレーションとハードウェア間の初期状態の不一致がポリシー転送に与える影響は何か?また、構造的ポリシーはこれを緩和できるか?

主な発見

  • 純粋なニューラルネットワークポリシーは、シミュレーションからハードウェアへの転送でたった20%の成功率にとどまり、主に初期の脚力が高いため転倒するためである。
  • ニューラルネットワークがヒューリスティック制御則を改善する構造的ニューラルネットワークポリシーは、ハードウェアで80%の成功率を達成し、純粋なNNアプローチを著しく上回った。
  • 構造的ポリシーは、シミュレーションとハードウェア間の脚力の不一致を補正することで、初期の不安定要因を低減し、初期の歩行フェーズをより安定させた。
  • エキスパートはトレーニング後、速度フィードバックゲインの調整など制御則を変更可能であり、速度変動への頑健性が向上した。
  • 高トルクを罰するコスト関数を用いることで、構造的ポリシーの転送成功率は100%に向上し、保守的なトレーニングが頑健性を向上させることを示した。
  • 構造的ポリシーは直感的な制御論理を維持しながら、ニューラルネットワークが状態依存の改善を学習できるようにし、より良い不整合抑止と容易な干渉を可能にした。
Figure 2 : Pipeline of the expert controller for controlling ATRIAS.
Figure 2 : Pipeline of the expert controller for controlling ATRIAS.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。