Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning for Tensegrity Robot Locomotion

Marvin Zhang, Xinyang Geng|arXiv (Cornell University)|Sep 28, 2016
Structural Analysis and Optimization参考文献 30被引用数 11
ひとこと要約

本論文では、ミラー降下誘導ポリシー探索(MDGPS)に基づく深層強化学習手法を提案し、テンスグリティロボットの周期的でフィードバックベースの歩行ポリシーを学習する。シミュレーションで訓練されたポリシーは、実世界の条件にも一般化でき、オンボードの加速度計センサーからのフィードバックのみを用いて、物理的SUPERballロボットで初めて連続的で信頼性の高い転がり歩行を実現した。100秒間で最大12メートルの移動を達成した。

ABSTRACT

Tensegrity robots, composed of rigid rods connected by elastic cables, have a number of unique properties that make them appealing for use as planetary exploration rovers. However, control of tensegrity robots remains a difficult problem due to their unusual structures and complex dynamics. In this work, we show how locomotion gaits can be learned automatically using a novel extension of mirror descent guided policy search (MDGPS) applied to periodic locomotion movements, and we demonstrate the effectiveness of our approach on tensegrity robot locomotion. We evaluate our method with real-world and simulated experiments on the SUPERball tensegrity robot, showing that the learned policies generalize to changes in system parameters, unreliable sensor measurements, and variation in environmental conditions, including varied terrains and a range of different gravities. Our experiments demonstrate that our method not only learns fast, power-efficient feedback policies for rolling gaits, but that these policies can succeed with only the limited onboard sensing provided by SUPERball's accelerometers. We compare the learned feedback policies to learned open-loop policies and hand-engineered controllers, and demonstrate that the learned policy enables the first continuous, reliable locomotion gait for the real SUPERball robot. Our code and other supplementary materials are available from http://rll.berkeley.edu/drl_tensegrity

研究の動機と目的

  • 複雑でアンダーアクチュエートされた動的特性を有するテンスグリティロボットを制御する課題に取り組むこと。
  • 手作業で設計されたポリシークラスやデモンストレーションに依存せずに、自動的に効率的で周期的な歩行ガイトを発見する学習ベースのアプローチを開発すること。
  • 環境条件、システムパラメータ、センサー雑音の変化に対しても頑健に一般化できることを実現し、特に実世界への展開を念頭に置いたものとする。
  • フィードバックポリシーが深層強化学習で学習されたものである場合、オープンループポリシーおよび手作業で設計された制御器を上回る頑健性と適応性を示すことを実証すること。

提案手法

  • 安定したガイト行動を捉えるために、多様な初期状態から順次単純なポリシーを訓練することで、周期的歩行を扱えるようにミラー降下誘導ポリシー探索(MDGPS)を拡張する。
  • 深層ニューラルネットワークを用いて最終ポリシーを表現することで、センサー入力に応じて適応する表現力豊かな閉ループ制御を実現する。
  • 複数の短いホライズンポリシーを最初に訓練することで、最終ポリシーの強力な初期化を実現するカリキュラム学習戦略を実装する。
  • シミュレーション環境を活用してポリシーを訓練し、実際のSUPERballロボットに最小限のファインチューニングで直接転送する。
  • 実時間での適応を可能にするために、オンボードの加速度計フィードバックを活用し、シミュレーションと実ハードウェアの差異を補償する。
  • 長時間にわたる安定した周期的運動、前進の促進、エネルギー効率性を促進する報酬形状戦略を採用する。

実験結果

リサーチクエスチョン

  • RQ1手作業で設計されたポリシー構造に依存せずに、深層強化学習を用いてテンスグリティロボットの安定的で周期的な歩行ガイトを学習可能か?
  • RQ2シミュレーションで訓練されたポリシーは、センサー雑音、アクチュエータの遅延、機械的非線形性を伴う実世界のハードウェアにどの程度一般化できるか?
  • RQ3学習されたフィードバックポリシーは、オープンループポリシーおよび手作業で設計された制御器と比較して、頑健性と適応性の面で優れているか?
  • RQ4再訓練なしに重力、地形、ロボットパラメータの変化に対しても、1つのポリシーが一般化可能か?

主な発見

  • 学習されたフィードバックポリシーは、物理的SUPERballロボットで連続的で信頼性の高い歩行を達成し、3回の試行で100秒間で最大12メートルを移動した。
  • 重力、地形、システムパラメータの変化に対してもポリシーが効果的に一般化され、環境的・ハードウェア的変動に対する頑健性を示した。
  • シミュレーションと現実の差異を補うために、オンボードの加速度計フィードバックのみを用いて、実世界の状況に成功して適応した。
  • オープンループポリシーは、モータードライビングの不一致とケーブルのヒステリシスの不一致により、実ロボットで完全に失敗した。これにより、フィードバックの必要性が明確になった。
  • 学習されたポリシーは、以前の制御器よりもリスクが低く、信頼性が高かった。これにより、ハードウェアへのストレスが軽減され、安全性が向上した。
  • 本手法はたった数百回の訓練試行で実現可能であり、将来的な実世界での直接訓練の可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。