Skip to main content
QUICK REVIEW

[论文解读] Deep Radial-Basis Value Functions for Continuous Control

Kavosh Asadi, Neev Parikh|arXiv (Cornell University)|Feb 5, 2020
Reinforcement Learning in Robotics被引用 5
一句话总结

本文提出用于连续控制的深度径向基值函数(RBF-VFs),采用归一化的高斯径向基函数来近似状态-动作值函数。证明了最优动作位于RBF网络的锚点集合中,且误差随平滑参数β呈指数衰减,从而实现在连续动作空间中高效且精确的值函数最大化。

ABSTRACT

A core operation in reinforcement learning (RL) is finding an action that is optimal with respect to a learned value function. This operation is often challenging when the learned value function takes continuous actions as input. We introduce deep radial-basis value functions (RBVFs): value functions learned using a deep network with a radial-basis function (RBF) output layer. We show that the maximum action-value with respect to a deep RBVF can be approximated easily and accurately. Moreover, deep RBVFs can represent any true value function owing to their support for universal function approximation. We extend the standard DQN algorithm to continuous control by endowing the agent with a deep RBVF. We show that the resultant agent, called RBF-DQN, significantly outperforms value-function-only baselines, and is competitive with state-of-the-art actor-critic algorithms.

研究动机与目标

  • 开发一种适用于连续控制的值函数近似方法,实现在连续动作空间上的高效且精确的最大化。
  • 证明在连续动作上,RBF值函数的最大值在预定义锚点之一处取得,误差呈指数衰减。
  • 在光滑性和连续性假设下,为深度RBF值函数在近似真实值函数时建立理论收敛保证。
  • 提供一个实用的深度学习框架,用于基于RBF的值函数学习,并在多个环境中进行超参数调优。

提出的方法

  • 使用归一化的高斯径向基函数(RBF)网络来参数化值函数 $\widehat{Q}_{\beta}(s,a;\theta)$,其中每个基函数以离散动作锚点 $a_i$ 为中心。
  • 对RBF权重应用Softmax归一化,确保其和为1,形成锚点处值预测的凸组合。
  • 证明在一维动作空间中,最大值在某个锚点处取得;在高维空间中,真实最大值与锚点最大值之间的误差为 $\mathcal{O}(e^{-\beta})$。
  • 采用梯度上升法,结合调优后的学习率和迭代步数,对连续动作上的RBF值函数进行最大化,利用最大值靠近锚点的特性。
  • 使用随机搜索和网格搜索在多个环境中对超参数(如β、学习率、优化器、梯度步数)进行调优。
  • 基于线性规划和连续性的理论证明表明,当β足够大时,值函数可一致地在 $\epsilon$ 误差范围内逼近任意连续的 $Q^\pi(s,a)$。

实验结果

研究问题

  • RQ1能否仅使用有限个锚点集合,高效地近似连续动作空间上深度RBF值函数的最大值?
  • RQ2真实最大值与锚点最大值之间的近似误差如何随平滑参数β变化?
  • RQ3深度RBF值函数能否以任意精度一致逼近任意连续的状态-动作值函数 $Q^\pi(s,a)$?
  • RQ4哪些超参数设置(如β、学习率、优化器)在多种连续控制环境中能实现最优性能?
  • RQ5与标准深度强化学习基线方法(如DDPG和TD3)相比,基于RBF的方法在最终性能上表现如何?

主要发现

  • 在一维动作空间中,RBF值函数的最大值恰好在某个锚点 $a_i$ 处取得,确保离散化不会导致最优性损失。
  • 在高维动作空间($\mathcal{A} = \mathbb{R}^d$)中,真实最大值与锚点最大值之间的差异被限制在 $\mathcal{O}(e^{-\beta})$ 范围内,且随β指数衰减。
  • 理论分析表明,对于任意连续的 $Q^\pi(s,a)$,当β足够大时(即 $\beta \geq \beta_0 = -\frac{1}{\mu}\log(\frac{\epsilon}{8N\sup_a|Q^\pi(s,a)|})$),深度RBF值函数可在所有 $s$ 和 $a$ 上以 $\epsilon$ 误差内一致逼近它。
  • 实验评估表明,RBF-DQN在9个连续控制领域中的最终性能优于DDPG和TD3,且超参数通过随机搜索和网格搜索进行调优。
  • 该方法在使用固定网络架构(1–3个隐藏层,含128或512个单元)时表现出稳健性能,最优超参数基于3次运行的平均回合回报选择。
  • RBF方法通过在锚点附近进行梯度上升,实现了高效且精确的动作选择,避免了对连续动作空间的穷举搜索。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。