Skip to main content
QUICK REVIEW

[論文レビュー] Deep Radial-Basis Value Functions for Continuous Control

Kavosh Asadi, Neev Parikh|arXiv (Cornell University)|Feb 5, 2020
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

この論文は、連続的制御のための深層ラジアル基底関数価値関数(RBF-VF)を提案し、正規化されたガウス型ラジアル基底関数を用いて状態-行動価値関数を近似する。最適な行動がRBFネットワーク内のアンカーポイントの集合に含まれることを証明し、誤差が滑らかさパラメータβに関して指数関数的に減少することを示し、連続的行動空間における価値関数の最大化を効率的かつ正確に行えるようにする。

ABSTRACT

A core operation in reinforcement learning (RL) is finding an action that is optimal with respect to a learned value function. This operation is often challenging when the learned value function takes continuous actions as input. We introduce deep radial-basis value functions (RBVFs): value functions learned using a deep network with a radial-basis function (RBF) output layer. We show that the maximum action-value with respect to a deep RBVF can be approximated easily and accurately. Moreover, deep RBVFs can represent any true value function owing to their support for universal function approximation. We extend the standard DQN algorithm to continuous control by endowing the agent with a deep RBVF. We show that the resultant agent, called RBF-DQN, significantly outperforms value-function-only baselines, and is competitive with state-of-the-art actor-critic algorithms.

研究の動機と目的

  • 連続的行動空間における効率的かつ正確な最大化を可能にする、連続的制御のための価値関数近似手法を開発すること。
  • RBF価値関数の連続的行動における最大値が、ある有限のアンカーポイントで達成されることを証明し、誤差がβに関して指数関数的に減少することを示すこと。
  • 滑らかさと連続性の仮定の下で、真の価値関数を近似する深層RBF価値関数の理論的収束保証を確立すること。
  • 複数の環境にわたるハイパーパrameterチューニングを含む、RBFに基づく価値関数学習の実用的なディープラーニングフレームワークを提供すること。

提案手法

  • 各基底関数が離散的行動アンカーポイント $a_i$ に中心を持つ正規化されたガウス型ラジアル基底関数(RBF)ネットワークを用いて、価値関数 $\widehat{Q}_{\beta}(s,a;\theta)$ をパラメータ化する。
  • RBF重みにソフトマックス正規化を適用し、合計が1になるようにすることで、アンカーポイントにおける価値予測の凸結合を形成する。
  • 1次元の行動空間では、最大値がアンカーポイントのいずれかで達成され、高次元では、真の最大値とアンカーポイントの最大値との間の誤差が $\mathcal{O}(e^{-\beta})$ であることを証明する。
  • 勾配上昇法を用い、最適なステップサイズとステップ数を調整して、連続的行動上でのRBF価値関数を最大化する。最大値がアンカーポイント付近にあるという事実を活用する。
  • 複数の環境にわたるハイパーパラメータ(β、学習率、最適化手法、勾配ステップ数)のチューニングに、ランダムサーチとグリッドサーチを用いる。
  • 線形計画法と連続性に基づく理論的証明を用い、十分に大きなβに対して、任意の連続的 $Q^\pi(s,a)$ が、すべての $s$ と $a$ に対して $\epsilon$ の誤差内で一様に近似可能であることを示す。

実験結果

リサーチクエスチョン

  • RQ1連続的行動空間における深層RBF価値関数の最大値は、有限個のアンカーポイントのみを用いて、効率的に近似可能か?
  • RQ2真の最大値とアンカーポイントにおける最大値との間の近似誤差は、滑らかさパラメータβとどのように関係するか?
  • RQ3深層RBF価値関数は、任意の精度で任意の連続的状態-行動価値関数 $Q^\pi(s,a)$ を一様に近似可能か?
  • RQ4異なる連続的制御環境で最適なパフォーマンスを発揮するハイパーパラメータ設定(例:β、学習率、最適化手法)は何か?
  • RQ5標準的な深層強化学習ベースライン(DDPGやTD3)と比較して、RBFベースのアプローチは最終的なパフォーマンスで優れているか?

主な発見

  • 1次元の行動空間では、RBF価値関数の最大値が正確にアンカーポイント $a_i$ のいずれかで達成され、離散化による最適性の損失がないことが保証される。
  • 高次元の行動空間($\mathcal{A} = \mathbb{R}^d$)では、真の最大値とアンカーポイントにおける最大値との差が $\mathcal{O}(e^{-\beta})$ で有界であり、βとともに指数関数的に減少する。
  • 理論的分析により、任意の連続的 $Q^\pi(s,a)$ に対して、$\beta$ が十分に大きい場合、すなわち $\beta \geq \beta_0 = -\frac{1}{\mu}\log(\frac{\epsilon}{8N\sup_a|Q^\pi(s,a)|})$ のとき、すべての $s$ と $a$ に対して $\epsilon$ の誤差内で一様に近似可能であることが示された。
  • 実験的評価では、9つの連続的制御ドメインにおいて、ハイパーパラメータをランダムサーチとグリッドサーチでチューニングしたRBF-DQNがDDPGやTD3を上回る最終的パフォーマンスを達成した。
  • 固定されたネットワークアーキテクチャ(1〜3層の隠れ層、128または512ユニット)を用い、3回の実行における平均エピソードリターンに基づいて最適なハイパーパラメータを選択することで、環境をまたがる安定したパフォーマンスを達成した。
  • RBFアプローチにより、アンカーポイント付近での勾配上昇法を用いることで、連続的行動の全探索を避けて、効率的かつ正確な行動選択が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。