Skip to main content
QUICK REVIEW

[論文レビュー] Learning Agile Locomotion via Adversarial Training

Yujin Tang, Jie Tan|arXiv (Cornell University)|Aug 3, 2020
Robotic Locomotion and Control参考文献 40被引用数 5
ひとこと要約

本論文では、四足歩行ロボットが、特化した回避行動をとる複数の敵対的アジェントのアンサンブルを追跡することで、アジリティな歩行を学習する敵対的訓練フレームワークを提案する。Covariance Matrix Adaptation-Evolution Strategy (CMA-ES) を用いて、繰り返しポリシーを最適化する。わずか3世代の学習後、本手法は、追跡速度、バランス、未観測の敵対的アジェントへの一般化性能において、ベースラインおよび最先端のマルチエージェント強化学習アルゴリズムを大きく上回る制御器を生成する。

ABSTRACT

Developing controllers for agile locomotion is a long-standing challenge for legged robots. Reinforcement learning (RL) and Evolution Strategy (ES) hold the promise of automating the design process of such controllers. However, dedicated and careful human effort is required to design training environments to promote agility. In this paper, we present a multi-agent learning system, in which a quadruped robot (protagonist) learns to chase another robot (adversary) while the latter learns to escape. We find that this adversarial training process not only encourages agile behaviors but also effectively alleviates the laborious environment design effort. In contrast to prior works that used only one adversary, we find that training an ensemble of adversaries, each of which specializes in a different escaping strategy, is essential for the protagonist to master agility. Through extensive experiments, we show that the locomotion controller learned with adversarial training significantly outperforms carefully designed baselines.

研究の動機と目的

  • 手動による報酬関数や環境の設計を極力避けて、脚立ロボットのアジリティな歩行制御器を設計する課題に対処すること。
  • 追跡者と回避者との間の敵対的セルフプレイが、手動による報酬形状なしに、アジリティに富んだ動的行動を自然に誘発できるかを調査すること。
  • 単一の敵対的アジェントやベースライン設定と比較して、戦略特化型の敵対的アジェントのアンサンブルを用いた学習が、一般化性能とロバストネスを向上させるかを評価すること。
  • actor-critic手法が失敗するマルチエージェント敵対的設定においても、CMA-ESのような発展的戦略が、複雑な歩行ポリシーを効果的に訓練できるかを示すこと。
  • 得られた制御器が、訓練中に見られなかった敵対的戦略や複雑な軌道に対しても、優れた一般化性能を示し、注意深く設計されたベースラインを上回ることを示すこと。

提案手法

  • 本手法は、四足歩行ロボット(主役)がターゲットを追跡し、ターゲット(敵対的アジェント)が回避を学習するマルチエージェント敵対的設定を採用し、共進化的学習プロセスを構築する。
  • 主役のポリシーは、CMA-ES(導出を必要としない発展的戦略)を用いて最適化され、報酬の累積性能に基づいてポリシー・パrameterのガウス分布をサンプリング・更新する。
  • 過学習を防ぐために、異なる回避戦略(例:横方向の回避、急停止)に特化した複数の敵対的アジェントのアンサンブルを訓練し、多様で挑戦的な学習シナリオを確保する。
  • 学習プロセスは分離されている:追跡と回避行動は反復的に最適化され、MADDPG や MATD3 などの actor-critic 手法がこの共同学習設定で失敗するため、学習の安定化を図る。
  • 報酬関数は、速度、接近度、捕獲成功を促進するように設計されており、割引率(γ = 1)を用い、長時間スケールの性能に注目する。
  • 一般化性能は、訓練中に使用されなかった敵対的アジェントに対して主役をテストすることで評価され、捕獲率、転倒率、ターゲットまでの距離、方位誤差といった指標が用いられる。

実験結果

リサーチクエスチョン

  • RQ1手動による報酬形状なしに、追跡者と回避者との敵対的セルフプレイが、アジリティに富んだ動的歩行行動を誘発できるか?
  • RQ2戦略特化型の敵対的アジェントのアンサンブルを用いた学習は、単一の敵対的アジェントを用いた場合と比較して、よりロバストで一般化可能な歩行ポリシーをもたらすか?
  • RQ3本手法が、注意深く設計されたベースライン環境および最先端のマルチエージェント強化学習アルゴリズムと比較して、性能および一般化性能でどのように差をつけるか?
  • RQ4学習された制御器は、訓練データに存在しない未確認の敵対的戦略や複雑な軌道に対し、どの程度一般化できるか?
  • RQ5なぜ actor-critic を用いたマルチエージェント強化学習手法(MADDPG や MATD3)は、このマルチエージェント歩行設定で失敗するのか?そして、発展的戦略はその制限を克服できるか?

主な発見

  • わずか3世代の敵対的学習後、主役は高速で安定した追跡を可能にするアジリティに富んだ歩行を学習し、追跡速度とバランスの両面ですべてのベースラインを上回る。
  • 敵対的アジェントのアンサンブルを用いて訓練した制御器は、未観測の敵対的アジェントに対して98%の捕獲率を達成し、次に優れたベースライン(π_single では51%)を大きく上回る。
  • 複雑なサイン曲線およびジグザグ軌道に沿った追跡タスクにおいて、敵対的ポリシーは平均して方位誤差(θ)を0.14ラジアンに保ち、最良のベースライン(0.47ラジアン)と比較して、はるかに優れた追従精度を示す。
  • 未観測の敵対的アジェントテストにおいて、転倒率は0%に低下した一方、ベースラインは100エピソードあたり最大11回の転倒を記録し、優れた安定性とロバストネスを示す。
  • 単一の敵対的アジェント(π_single)を用いた学習は、高速走行に依存するが、曲がりくねった軌道では失敗するため、過学習が生じる。これは、一般化のためにはアンサンブルの導入が不可欠であることを示している。
  • 敵対的訓練スキームにより、主役は急停止や急旋回といった複雑な動きを習得でき、注意深く設計されたベースライン環境ですら学習できない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。