[论文解读] Exploration-Exploitation Trade-off in Reinforcement Learning on Online Markov Decision Processes with Global Concave Rewards
该论文提出Toc-UCRL2,一种针对具有全局凹奖励的在线马尔可夫决策过程的无遗憾算法,其中智能体必须在时间上平衡向量结果。通过引入一种新颖的梯度阈值程序以延迟更新,该方法实现了非平稳策略,有效管理探索-利用权衡,同时在平均奖励设置下实现了接近最优的遗憾界 $ O(T^{-1/3}) $。
We consider an agent who is involved in a Markov decision process and receives a vector of outcomes every round. Her objective is to maximize a global concave reward function on the average vectorial outcome. The problem models applications such as multi-objective optimization, maximum entropy exploration, and constrained optimization in Markovian environments. In our general setting where a stationary policy could have multiple recurrent classes, the agent faces a subtle yet consequential trade-off in alternating among different actions for balancing the vectorial outcomes. In particular, stationary policies are in general sub-optimal. We propose a no-regret algorithm based on online convex optimization (OCO) tools (Agrawal and Devanur 2014) and UCRL2 (Jaksch et al. 2010). Importantly, we introduce a novel gradient threshold procedure, which carefully controls the switches among actions to handle the subtle trade-off. By delaying the gradient updates, our procedure produces a non-stationary policy that diversifies the outcomes for optimizing the objective. The procedure is compatible with a variety of OCO tools.
研究动机与目标
- 解决在线MDP中具有向量结果和全局凹奖励函数时的微妙探索-利用权衡问题。
- 设计一种无遗憾学习算法,在非渐近设置下优化平均向量奖励的非线性、全局目标。
- 通过实现可控的动作切换,克服在具有多个常返类的MDP中平稳策略的次优性。
- 将在线凸优化(OCO)工具与UCRL2结合,实现在复杂奖励结构下的可扩展、自适应策略学习。
- 开发一种梯度阈值程序,通过延迟更新以在动作之间的状态转换期间保持目标性能。
提出的方法
- 提出Toc-UCRL2,一种混合算法,结合UCRL2进行模型学习与在线凸优化(OCO)以实现奖励平衡。
- 引入一种新颖的梯度阈值程序,通过延迟梯度更新以减少动作间转换期间的性能损失。
- 使用带1-强凸镜映射的镜面下降法,以确保对偶变量更新的稳定性和收敛性。
- 采用基于回合的学习方法,利用置信区间在不确定性超过阈值时触发策略更新。
- 基于累积梯度变化设计停止条件,以控制动作切换时机,最小化目标性能下降。
- 通过分析由梯度变化触发的回合数($ M^{ ext{TMD}}_{ ext{Ψ}}(T) $)和访问次数($ M^{ ext{TMD}}_{ u}(T) $)推导遗憾界。
实验结果
研究问题
- RQ1当平稳策略次优时,能否为具有全局凹奖励的在线MDP设计一种无遗憾算法?
- RQ2如何控制状态间动作的切换,以最小化性能损失,同时平衡向量结果?
- RQ3在具有多个常返类的MDP中,探索、利用与结果平衡之间的最优权衡是什么?
- RQ4非平稳策略能否在具有向量性、非线性目标的平均奖励设置下实现接近最优的遗憾?
- RQ5在线凸优化工具如何适应处理具有凹奖励函数的MDP的结构复杂性?
主要发现
- 所提出的Toc-UCRL2算法实现了 $ O\big((L' + \frac{\tilde{L}D}{\tilde{Q}} + \tilde{L}\tilde{Q}) \norm{\bm{1}_K} T^{-1/3} + \tilde{L}\norm{\bm{1}_K} D \norm{\bm{1}_K} \frac{1}{\tilde{T}^{1/2}} \big) $ 的遗憾界,该界为次线性且接近最优。
- 梯度阈值程序成功延迟了更新,减少了转换期间的性能损失,实现了向量结果的有效平衡,同时不损害目标性能。
- 由梯度变化触发的回合数受 $ 1 + \tilde{L}' / \tilde{Q} \times T^{2/3} $ 限制,该限制控制了策略更新的频率并确保了稳定性。
- 该算法在平均奖励设置下实现了 $ O(T^{-1/3}) $ 的遗憾,优于先前在非平稳、向量性MDP中的结果。
- 该方法与多种OCO工具兼容,并将在线凸优化的适用性扩展至具有凹奖励的结构化MDP。
- 分析证实,在具有多个常返类的MDP中,平稳策略通常次优,从而证明了非平稳、自适应策略的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。