[论文解读] Online Learning and Optimization of Markov Jump Affine Models
本文提出了一种马尔可夫同步扰动随机逼近(MSPSA)算法,用于在线学习和优化具有未知参数的马尔可夫跳跃仿射模型。MSPSA 在二次成本最小化和收益最大化两种情况下均实现了 $\Theta(\sqrt{T})$ 的最优阶 regret 增长,并且以概率几乎处处和均方意义收敛到最优控制输入。
The problem of online learning and optimization of unknown Markov jump affine models is considered. An online learning policy, referred to as Markovian simultaneous perturbations stochastic approximation (MSPSA), is proposed for two different optimization objectives: (i) the quadratic cost minimization of the regulation problem and (ii) the revenue (profit) maximization problem. It is shown that the regret of MSPSA grows at the order of the square root of the learning horizon. Furthermore, by the use of van Trees inequality, it is shown that the regret of any policy grows no slower than that of MSPSA, making MSPSA an order optimal learning policy. In addition, it is also shown that the MSPSA policy converges to the optimal control input almost surely as well as in the mean square sense. Simulation results are presented to illustrate the regret growth rate of MSPSA and to show that MSPSA can offer significant gain over the greedy certainty equivalent approach.
研究动机与目标
- 解决由马尔可夫跳跃过程驱动、具有未知时变参数的系统中的在线学习与控制挑战。
- 将问题形式化为不确定环境下的序列决策问题,平衡探索与利用。
- 建立马尔可夫跳跃仿射模型在两种目标下 regret 增长的基本极限:二次成本最小化和收益最大化。
- 设计一种在线学习策略,实现最低可能的 regret 增长率,与理论下界相匹配。
- 证明学习策略以概率几乎处处和均方意义收敛到最优控制输入。
提出的方法
- 提出马尔可夫同步扰动随机逼近(MSPSA)算法,这是一种针对马尔可夫跳跃仿射模型的新型在线学习策略。
- 利用同步扰动估计成本/收益函数关于控制输入的梯度,实现高效的在线自适应。
- 应用随机逼近理论,基于噪声观测更新控制输入,确保在时变系统动态下的收敛性。
- 利用 van Trees 不等式推导 regret 增长的下界,证明 MSPSA 实现了最优阶性能。
- 引入重参数化和自适应学习规则,即使在系统矩阵不可逆的情况下,也能保证估计的一致性和收敛性。
- 利用 FOC(一阶条件)和隐函数定理,将最优控制输入表征为底层马尔可夫状态和系统参数的函数。
实验结果
研究问题
- RQ1对于具有未知参数的马尔可夫跳跃仿射模型,在线学习的 regret 增长的根本极限是什么?
- RQ2能否设计一种在线学习策略,在二次成本最小化和收益最大化两种目标下,均实现最低可能的 regret 增长率?
- RQ3与贪婪确定性等价方法相比,所提出的 MSPSA 算法在 regret 和收敛性方面表现如何?
- RQ4在何种条件下,学习策略能以概率几乎处处和均方意义收敛到最优控制输入?
- RQ5van Trees 不等式能否用于推导此类时变随机系统的非渐近 regret 下界?
主要发现
- MSPSA 策略的 regret 增长阶为 $\sqrt{T}$,与通过 van Trees 不等式推导出的理论下界一致。
- MSPSA 策略为最优阶,因为没有任何其他策略能实现比 $\Theta(\sqrt{T})$ 更慢的 regret 增长率。
- 在温和的正则性条件下,MSPSA 算法以概率几乎处处和均方意义收敛到最优控制输入。
- 仿真结果证实,与贪婪确定性等价方法相比,MSPSA 在早期学习阶段显著降低了 regret。
- 通过 van Trees 不等式推导出的 regret 下界表明,MSPSA 不仅在阶上最优,而且实现了与时间范围的最佳可能缩放。
- 即使系统矩阵不可逆,该方法依然有效,将先前自适应控制的研究成果扩展到更广泛的模型类别。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。