Skip to main content
QUICK REVIEW

[論文レビュー] Distributed Soft Actor-Critic with Multivariate Reward Representation and Knowledge Distillation

D. Akimov|arXiv (Cornell University)|Nov 29, 2019
Reinforcement Learning in Robotics被引用数 7
ひとこと要約

本論文は、NeurIPS 2019 Learn to Move チャレンジ向けに、多次元報酬表現と知識蒸留を用いた分散型ソフトアクタクリティクス(SAC)エージェントを提示する。この手法は二段階の訓練プロセスを採用しており、まず一般の移動を学習し、その後でターゲット速度場に従う。知識蒸留を用いて事前学習済みの教師エージェントから学生エージェントへ行動を転送し、平均報酬1303.727、コンペティションで3位を達成した。

ABSTRACT

In this paper, we describe NeurIPS 2019 Learning to Move - Walk Around challenge physics-based environment and present our solution to this competition which scored 1303.727 mean reward points and took 3rd place. Our method combines recent advances from both continuous- and discrete-action space reinforcement learning, such as Soft Actor-Critic and Recurrent Experience Replay in Distributed Reinforcement Learning. We trained our agent in two stages: to move somewhere at the first stage and to follow the target velocity field at the second stage. We also introduce novel Q-function split technique, which we believe facilitates the task of training an agent, allows critic pretraining and reusing it for solving harder problems, and mitigate reward shaping design efforts.

研究の動機と目的

  • 物理ベースの3次元ヒューマンモデルにおける複雑な歩行制御のためのサンプル効率の高い強化学習エージェントの開発を目的とする。
  • 最小限の努力で高い報酬を得るために、動的ターゲット速度場に従う能力を学習する課題に対処することを目的とする。
  • 多次元報酬表現と知識蒸留を用いて、訓練の安定性とデータ効率を向上させることを目的とする。
  • 完全な再訓練なしに、より難しいタスクを解決するための事前学習済み方策を効果的に転送できることを目的とする。

提案手法

  • エージェントは、パフォーマンスと探索のバランスを取るために、最大エントロピー強化学習を用いたソフトアクタクリティクス(SAC)を採用する。
  • 二段階の訓練プロセスが採用されている:まず一般移動を学習し、その後でターゲット速度場に従う。
  • 多次元報酬表現は、ターゲット速度場をポリシーおよびクライミックネットワークへの2次元ベクトル場入力として符号化する。
  • 知識蒸留により、ターゲット速度入力を受けていない事前学習済みの教師エージェントから、速度場入力を受ける学生エージェントへ行動を転送する。
  • 蒸留プロセスは、学生と教師のポリシー間のKLダイバージェンスと、クライミックQ値間の平均二乗誤差を最小化する。
  • 並列エージェントと優先順位付き経験再生を用いて、訓練を加速し、データ効率を向上させる。

実験結果

リサーチクエスチョン

  • RQ1複雑なターゲットダイナミクスを伴う連続的制御タスクにおいて、多次元報酬表現はポリシーの一般化を向上させるか?
  • RQ2知識蒸留は、より単純なタスクからより複雑なタスクへの歩行ポリシー転送において、どの程度効果的か?
  • RQ3段階的報酬形状を用いた段階的訓練は、歩行制御におけるサンプル効率を向上させるか?
  • RQ4より簡単なタスクで事前学習することで、より難しいターゲットタスクでの最終パフォーマンスはどの程度向上するか?
  • RQ5SACのようなオフポリシー法と蒸留を組み合わせることで、複雑で高次元の制御環境でも高いパフォーマンスを達成できるか?

主な発見

  • エージェントは平均報酬1303.727を達成し、NeurIPS 2019 Learn to Move コンペティションで3位を獲得した。
  • 知識蒸留は44分で完了し、KLダイバージェンスで測定したところ、学生ポリシーは教師とほぼ同一の行動を示した。
  • 二段階の訓練プロセスにより、効果的な探索と、より難しい難易度レベルでの迅速な収束が実現された。
  • 難易度3での訓練には、ターゲット速度場の中心で安定して立つよう学習するため、追加で160時間の訓練が必要だった。
  • 事前学習済みのクライミックおよびポリシーネットワークからの転送が成功し、ロバストでデータ効率の高い性能を示した。
  • 最終的なエージェントはターゲット速度場に正確に従い、移動報酬およびターゲット速度報酬の両方を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。