[论文解读] VIREL: A Variational Inference Framework for Reinforcement Learning
该论文提出VIREL,一种用于强化学习的变分推断框架,将策略优化表述为期望最大化问题,从而实现价值函数与策略学习的独立、迭代更新。通过利用模式聚焦的KL散度和参数化的动作价值函数,VIREL能够学习确定性的最优策略,并在高维连续控制任务中优于SAC等最先进方法。
Applying probabilistic models to reinforcement learning (RL) enables the application of powerful optimisation tools such as variational inference to RL. However, existing inference frameworks and their algorithms pose significant challenges for learning optimal policies, e.g., the absence of mode capturing behaviour in pseudo-likelihood methods and difficulties learning deterministic policies in maximum entropy RL based approaches. We propose VIREL, a novel, theoretically grounded probabilistic inference framework for RL that utilises a parametrised action-value function to summarise future dynamics of the underlying MDP. This gives VIREL a mode-seeking form of KL divergence, the ability to learn deterministic optimal polices naturally from inference and the ability to optimise value functions and policies in separate, iterative steps. In applying variational expectation-maximisation to VIREL we thus show that the actor-critic algorithm can be reduced to expectation-maximisation, with policy improvement equivalent to an E-step and policy evaluation to an M-step. We then derive a family of actor-critic methods from VIREL, including a scheme for adaptive exploration. Finally, we demonstrate that actor-critic algorithms from this family outperform state-of-the-art methods based on soft value functions in several domains.
研究动机与目标
- 为解决现有强化学习推断框架的局限性,例如伪似然方法在模式捕获方面的不足,以及最大熵强化学习中与确定性策略的不兼容性。
- 提供一个理论基础坚实的框架,通过在动作价值函数中引入不确定性来引导探索,同时支持确定性策略学习。
- 正式整合值函数和策略网络中的函数逼近,确保在逼近情况下的收敛性分析。
- 将演员-评论家算法统一于单一的变分期望最大化框架下,其中策略改进对应E步,策略评估对应M步。
- 开发实用算法,自适应地平衡探索与利用,提升在复杂环境中的性能。
提出的方法
- VIREL使用参数化的动作价值函数 $\hat{Q}_{\omega}(h)$ 来总结未来动态,将强化学习问题表述为概率推断问题。
- 采用变分期望最大化算法,其中E步对应策略改进,M步对应价值函数评估。
- 框架使用一种模式聚焦的KL散度形式,以鼓励策略集中于高回报动作,从而提高样本效率。
- 通过重参数化梯度推导出策略和价值函数参数的解析更新,支持使用深度网络进行端到端训练。
- 推导出两种算法——virel与beta,后者通过估计的方差 $\varepsilon_{\omega}$ 引入自适应熵缩放。
- 该方法将策略与价值函数优化解耦,允许通过 $\bar{\phi}$ 进行目标网络平滑的独立、迭代更新。
实验结果
研究问题
- RQ1能否通过一种变分推断框架将强化学习中的演员-评论家方法统一于一个原则性的期望最大化框架下,同时支持确定性策略学习?
- RQ2与标准熵正则化相比,使用模式聚焦的KL散度在多大程度上能改善策略优化?
- RQ3在值函数和策略网络中,函数逼近能在多大程度上被正式整合进推断框架,并保证收敛性?
- RQ4所提出的框架是否能在高维连续控制任务中超越SAC等最先进方法?
- RQ5由动作价值函数不确定性驱动的自适应探索在多大程度上影响样本效率和最终性能?
主要发现
- VIREL在复杂且高维的MuJoCo环境中优于软演员-评论家(SAC)和DDPG,尤其在连续动作空间任务中表现更优。
- 该框架通过变分推断自然地学习到确定性的最优策略,无需依赖基于温度的熵正则化。
- 算法的beta变体通过估计Q函数误差的方差来实现探索的自适应调整,从而提升样本效率。
- 在简单低维任务中,VIREL与SAC和DDPG表现相当,但在复杂环境中性能差距显著扩大。
- 理论分析表明,策略改进与价值函数更新恰好对应于期望最大化算法中的E步与M步,提供了统一的优化框架。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。