[论文解读] Universal Reinforcement Learning
本文提出主动LZ算法,一种受Lempel-Ziv数据压缩启发的通用强化学习方法,用于在具有有限记忆依赖的未知环境中实现最优控制。当未来结果依赖于动作与观测的有界历史时,该方法可保证渐近平均成本最优性,通过上下文树建模与自适应探索,实现无需预先了解系统结构或记忆长度的最优策略收敛。
We consider an agent interacting with an unmodeled environment. At each time, the agent makes an observation, takes an action, and incurs a cost. Its actions can influence future observations and costs. The goal is to minimize the long-term average cost. We propose a novel algorithm, known as the active LZ algorithm, for optimal control based on ideas from the Lempel-Ziv scheme for universal data compression and prediction. We establish that, under the active LZ algorithm, if there exists an integer $K$ such that the future is conditionally independent of the past given a window of $K$ consecutive actions and observations, then the average cost converges to the optimum. Experimental results involving the game of Rock-Paper-Scissors illustrate merits of the algorithm.
研究动机与目标
- 开发一种强化学习算法,实现在具有未知有限记忆依赖性的环境中长期平均成本最优。
- 消除对系统转移核或记忆长度K的先验知识的需求。
- 结合通用数据压缩(Lempel-Ziv)与动态规划原理,实现无模型最优控制。
- 在弱假设下建立收敛至最优平均成本的理论保证。
- 实现在部分可观测或非马尔可夫环境中、具有有界历史依赖性的学习。
提出的方法
- 主动LZ算法使用受Lempel-Ziv启发的上下文树,对给定过去动作与观测的未来观测的条件分布进行建模。
- 通过随观测到的动作与观测序列动态增长的树结构,维护转移概率的估计值。
- 通过在估计最优动作的利用与树中较少访问的上下文探索之间取得平衡,实现自适应探索。
- 采用时变折扣因子α趋近于1的折扣值迭代框架,确保长期最优性。
- 使用加倍技巧方案,在无需预先知晓α的情况下实现平均成本最优性,通过逐步增加时域并调整探索率实现。
- 利用Borel-Cantelli引理与集中不等式,证明子最优动作仅以高概率有限次被采取。
实验结果
研究问题
- RQ1强化学习算法是否可在不预先知晓系统转移核或记忆长度的情况下,实现渐近平均成本最优性?
- RQ2如何将通用数据压缩原理适配于解决未知环境中最优控制问题?
- RQ3环境记忆结构的何种条件可确保收敛至最优策略?
- RQ4基于上下文树的自适应探索策略是否可保证强化学习中的长期最优性?
- RQ5在所提算法下,子最优动作所占比例收敛至零的速率如何?
主要发现
- 当环境的未来在给定K个连续动作与观测的有限窗口下,条件独立于过去时,主动LZ算法可保证渐近平均成本最优性。
- 算法选择子最优动作的时间比例以O((1/log T)^c)的速率收敛至零(c < 1),表明收敛速度较慢但可保证。
- 算法在无需预先知晓折扣因子α或记忆长度K的情况下实现最优性,通过使用βk = Ω(1/log log k)的加倍技巧方案实现。
- 理论分析表明,以高概率,贪婪动作在第k个周期内仅在最多O(2^k * (log log 2^k)^3 / log 2^k)个时间步内为子最优,从而确保长期最优性。
- 该方法对未知系统结构具有鲁棒性,可应用于如具有有限记忆对手的石头剪刀布问题,以及使用固定译码器的联合信源信道编码问题。
- 该框架提示可通过用上下文树加权方法替代基于LZ的上下文树,实现更快的收敛速率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。