Skip to main content
QUICK REVIEW

[論文レビュー] Discretizing Continuous Action Space for On-Policy Optimization

Yunhao Tang, Shipra Agrawal|arXiv (Cornell University)|Jan 29, 2019
Reinforcement Learning in Robotics参考文献 36被引用数 16
ひとこと要約

本稿では、方策を行動次元に跨いで因子化することにより、オンポリシー強化学習における連続的行動空間の離散化を提案し、PPO や TRPO などの最先端のアルゴリズムを用いた効率的な学習を可能にしている。さらに、離散的行動の間の自然な順序を符号化する順序付きパrameterization を導入し、特に複雑なダイナミクスを示す高次元制御タスクにおいて、サンプル効率と最終的な性能が顕著に向上している。

ABSTRACT

In this work, we show that discretizing action space for continuous control is a simple yet powerful technique for on-policy optimization. The explosion in the number of discrete actions can be efficiently addressed by a policy with factorized distribution across action dimensions. We show that the discrete policy achieves significant performance gains with state-of-the-art on-policy optimization algorithms (PPO, TRPO, ACKTR) especially on high-dimensional tasks with complex dynamics. Additionally, we show that an ordinal parameterization of the discrete distribution can introduce the inductive bias that encodes the natural ordering between discrete actions. This ordinal architecture further significantly improves the performance of PPO/TRPO.

研究の動機と目的

  • 連続的行動空間の離散化がオンポリシー強化学習の性能を向上させるかどうかを調査すること。
  • 行動次元に跨ぐ因子化された方策分布を用いて、行動組み合わせの組み合わせ爆発を緩和すること。
  • スティック・ブレイキングを用いた順序付きパrameterization により、離散的行動間の自然な順序を符号化することで、学習に有益なインダクティブバイアスが得られるかどうかを評価すること。
  • 高次元連続的制御環境において、離散的および順序付き方策を標準のガウスベースラインと比較すること。
  • 学習率や各行動次元あたりの離散的ボックス数といったハイパーパramータへのロバストネスを評価すること。

提案手法

  • 各次元ごとに K 個の離散的行動に連続的行動空間を分割し、M 次元の行動に対しては合計 K^M 個の結合離散的行動空間を形成する。
  • 各行動次元における周辺分布の積として表される因子化された方策を用い、計算複雑性を低減する。
  • 自然な順序を符号化するためのスティック・ブレイキングを用いた順序付きパrameterization を導入し、より滑らかな方策更新を可能にする。
  • PPO、TRPO、ACKTR などのオンポリシーアルゴリズムに離散的および順序付き方策を適用し、MuJoCo の歩行ベンチマークで学習を行う。
  • 固定されたハイパーパramータで方策を学習し、複数のランダムシードで性能を評価することで、ロバストネスを評価する。
  • 順序付きアーキテクチャにおける離散的行動の事前分布としてベータ分布を用い、微分可能なサンプリングと方策最適化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1連続的行動空間の離散化は、PPO や TRPO といったオンポリシーアルゴリズムの高次元制御タスクにおける性能を向上させるか?
  • RQ2離散的行動に跨ぐ因子化された方策は、行動の組み合わせの爆発的増加を緩和しつつ、性能を維持できるか?
  • RQ3スティック・ブレイキングによるパrameterization を用いて離散的行動間の自然な順序を符号化することで、方策最適化に有益なインダクティブバイアスが得られるか?
  • RQ4離 discrete/ordinal 方策は、標準のガウス方策ベースラインと比較して、サンプル効率および最終的性能で優れているか?
  • RQ5学習率や離散的ボックス数といったハイパーパramータの変化に対して、離散的および順序付き方策はどれほどロバストか?

主な発見

  • 因子化された行動分布を用いた離散的方策は、Humanoid や Ant といった高次元タスクでガウスベースラインを顕著に上回り、Walker2d では 4249±239(ガウスベースライン:3500±360)の報酬を達成し、Humanoid では 6018±403(ガウスベースライン:3905±502)を記録した。
  • 自然な順序を符号化する順序付き方策は、さらに性能を向上させ、Humanoid (R) で 4884±1562、Sim. Humanoid (R) で 801±569 の報酬を達成し、離散的方策をも上回った。
  • Humanoid タスクにおいて、PPO+順序付き方策は 6018±403 の報酬を達成し、最先端のオフポリシー学習アルゴリズムと同等の性能を示した。
  • 離散的方策は、学習率、K、ランダムシードの変化に対して、ガウスベースラインよりも高いロバストネスを示しており、30 種類のハイパーパramータ設定における分位数プロットから明らかになった。
  • TRPO 実験では、順序付き方策が全タスクで離散的方策を常に上回り、Ant で最大 2977±266、Humanoid Standup で最大 143418±8638 の向上を示した。
  • 図 4 の学習曲線から、K=11 の条件下で、全 MuJoCo 歩行タスクにおいて順序付き方策が離散的方策よりも速やかに収束し、より高い漸近的性能を達成していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。