[论文解读] Quinoa: a Q-function You Infer Normalized Over Actions
Quinoa 提出了一种新颖的演员-评论家强化学习算法,通过使用归一化流策略学习一个软 Q 函数,实现了无需独立策略优化的闭式最优策略推断。通过使用归一化流对复杂、多模态的动作分布进行建模,Quinoa 简化了训练过程,并在连续控制任务中实现了与最先进方法相当的性能,同时支持丰富、非高斯的探索。
We present an algorithm for learning an approximate action-value soft Q-function in the relative entropy regularised reinforcement learning setting, for which an optimal improved policy can be recovered in closed form. We use recent advances in normalising flows for parametrising the policy together with a learned value-function; and show how this combination can be used to implicitly represent Q-values of an arbitrary policy in continuous action space. Using simple temporal difference learning on the Q-values then leads to a unified objective for policy and value learning. We show how this approach considerably simplifies standard Actor-Critic off-policy algorithms, removing the need for a policy optimisation step. We perform experiments on a range of established reinforcement learning benchmarks, demonstrating that our approach allows for complex, multimodal policy distributions in continuous action spaces, while keeping the process of sampling from the policy both fast and exact.
研究动机与目标
- 消除离策略演员-评论家算法中对独立策略优化步骤的需求。
- 实现在连续动作空间中对复杂、多模态策略的精确、快速采样。
- 开发一种统一的学习目标,通过时序差分学习联合优化价值函数和策略。
- 利用归一化流支持任意、表达能力强的策略分布,同时保持闭式最优策略推断能力。
- 在连续控制基准测试中展示更高的策略表达能力与训练稳定性。
提出的方法
- 该方法使用相对熵正则化的强化学习目标来定义一个支持闭式最优策略推导的软 Q 函数。
- 通过以状态为条件的归一化流(具体为 Real NVP)参数化策略,实现通用密度逼近。
- 通过最小化经验回放缓冲区中转移样本的平方时序差分误差,利用时序差分学习来学习软 Q 函数。
- 通过在动作上对软 Q 函数进行归一化来获得最优策略,从而无需迭代策略优化。
- 通过目标网络和梯度裁剪联合训练价值函数和策略,以稳定训练过程。
- 该方法支持从策略中精确、高效地采样,同时支持非高斯、多模态和偏斜的动作分布。
实验结果
研究问题
- RQ1是否可以学习到一个软 Q 函数,使得最优策略能够以闭式形式获得,而无需迭代优化?
- RQ2归一化流是否能够在保持高效采样和训练的同时,实现在连续控制中表达性强、多模态的策略?
- RQ3在连续控制基准测试中,消除策略优化步骤是否能提升训练稳定性和性能?
- RQ4所提出的方法是否能够在支持更丰富策略分布的同时,实现与 SOTA 算法(如 SVG(0))相当的性能?
- RQ5与使用标准高斯策略学习的策略相比,所学策略在结构上(例如多模态、非高斯)有何不同?
主要发现
- 在 DeepMind Control Suite 的 Cheetah 和 Walker 任务中,Quinoa 的性能与 SVG(0) 相当,但在 Hopper 任务上表现略低。
- Quinoa 学习到的策略表现出非高斯特性,包括高偏度、非线性相关的噪声,以及动作空间中的有限支持。
- 在某些状态下,策略表现出多模态行为,例如在 Walker 环境中,策略会探索动作空间中的多个角落。
- 训练过程中,部分动作维度会坍缩,而其他维度则保持高方差以维持熵和探索能力。
- 由于归一化流的可逆性,即使在复杂分布下,该方法也能实现精确且快速的策略采样。
- 闭式策略推断消除了对独立策略优化的需求,从而简化了训练流程。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。