Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Learning of Control Policies for Robust Quadruped Bounding using Pretrained Neural Networks

Zhicheng Wang, Anqiao Li|arXiv (Cornell University)|Nov 1, 2020
Robotic Locomotion and Control参考文献 13被引用数 4
ひとこと要約

本稿では、実機のJueying Miniロボットへの直接適用を可能にする、データ効率の良い強化学習フレームワークを提案する。事前学習されたニューラルネットワーク方策を用い、モデルベース制御器からの模倣学習と、フェーズおよび接触状態に配慮した報酬関数による最適化により、安定した四足歩行の制御が可能となる。この手法により、シミュレーション上での効率的なDRL訓練が実現され、不整地な屋内・屋外の地形においても安定した歩行が達成された。

ABSTRACT

Bounding is one of the important gaits in quadrupedal locomotion for negotiating obstacles. The authors proposed an effective approach that can learn robust bounding gaits more efficiently despite its large variation in dynamic body movements. The authors first pretrained the neural network (NN) based on data from a robot operated by conventional model based controllers, and then further optimised the pretrained NN via deep reinforcement learning (DRL). In particular, the authors designed a reward function considering contact points and phases to enforce the gait symmetry and periodicity, which improved the bounding performance. The NN based feedback controller was learned in the simulation and directly deployed on the real quadruped robot Jueying Mini successfully. A variety of environments are presented both indoors and outdoors with the authors approach. The authors approach shows efficient computing and good locomotion results by the Jueying Mini quadrupedal robot bounding over uneven terrain.

研究の動機と目的

  • 四足歩行の制御方策の学習におけるサンプル効率の向上を目的とする。
  • 不整地の地形を走行する際の高次元的かつ動的な運動の制御課題に取り組む。
  • 学習した方策をシミュレーションから物理的ロボットへの直接移行を可能にする。
  • 強化学習における報酬形状の工夫により、歩行の対称性と周期性を維持する。
  • エンドツーエンドのRL訓練と比較して、訓練時間と計算コストを低減する。

提案手法

  • 四足歩行ロボットの従来のモデルベース制御器からのデモンストレーションを用いて、ニューラルネットワーク方策を事前学習する。
  • シミュレーション上で、事前学習済み方策を深層強化学習(DRL)を用いて微調整する。
  • 接触点のタイミングと歩行フェーズを明示的に報酬関数に組み込むことで、対称性と周期性を強制する。
  • 状態観測(ボディポーズと接触状態を含む)に基づいて、ニューラルネットワークが関節トルクを出力するフィードバック制御アーキテクチャを採用する。
  • 多様な地形変化を含むシミュレーション環境で方策を訓練し、耐障害性を向上させる。
  • 最終的な方策を、追加のチューニングを施さずに、実機のJueying Miniロボットに直接デプロイする。

実験結果

リサーチクエスチョン

  • RQ1モデルベース制御器からのデモンストレーションを用いた事前学習が、四足歩行のDRL方策学習におけるサンプル複雑性を顕著に低減できるか。
  • RQ2フェーズおよび接触状態に配慮した報酬関数は、対称的かつ周期的な歩行パターンの促進にどの程度有効か。
  • RQ3シミュレーションで学習した方策が、実世界の不整地の地形にどの程度一般化できるか。
  • RQ4エンドツーエンドRLと比較して、事前学習+微調整RLの訓練効率と耐障害性の面での性能差は何か。
  • RQ5最終的な方策は、ドメインランダマイゼーションやシミュレーションから実機への移行テクニックを用いずに、ハードウェアに直接デプロイ可能か。

主な発見

  • 事前学習および微調整済み方策は、Jueying Miniロボットが多様な屋内・屋外の地形において安定したバウンシング歩行を実現した。
  • エンドツーエンドDRL訓練と比較して、訓練時間とサンプル複雑性が低減された。
  • 接触およびフェーズの監視を組み込んだ報酬関数は、歩行の周期性と対称性を効果的に強制し、歩行品質の向上に寄与した。
  • 追加のシミュレーションから実機への適応ステップを施さずに、実機ロボットに方策が成功裏にデプロイされた。
  • 斜面や不整地など、地形の不規則性に対しても耐障害性を示した。
  • サンプル効率と実世界性能のバランスを図り、標準的なDRLに比べて訓練効率で優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。