[论文解读] Reinforcement Learning under Model Mismatch
该论文通过提出Q-learning、SARSA和TD-learning的鲁棒变体,将鲁棒马尔可夫决策过程扩展至无模型强化学习,使算法在模型不匹配条件下收敛至近似最优策略。该工作建立了在表格型设置和函数逼近设置(包括线性与非线性架构)下的收敛性,采用新型均方鲁棒投影贝尔曼误差损失(MSRPBE)与随机梯度下降方法。
We study reinforcement learning under model misspecification, where we do not have access to the true environment but only to a reasonably close approximation to it. We address this problem by extending the framework of robust MDPs to the model-free Reinforcement Learning setting, where we do not have access to the model parameters, but can only sample states from it. We define robust versions of Q-learning, SARSA, and TD-learning and prove convergence to an approximately optimal robust policy and approximate value function respectively. We scale up the robust algorithms to large MDPs via function approximation and prove convergence under two different settings. We prove convergence of robust approximate policy iteration and robust approximate value iteration for linear architectures (under mild assumptions). We also define a robust loss function, the mean squared robust projected Bellman error and give stochastic gradient descent algorithms that are guaranteed to converge to a local minimum.
研究动机与目标
- 解决在模型误设条件下强化学习的问题,即智能体从代理模型而非真实环境学习。
- 将原本用于模型基规划的鲁棒MDP框架扩展至仅具有样本访问权限的无模型强化学习设置。
- 开发经典时序差分算法(Q-learning、SARSA、TD)的鲁棒版本,证明其在弱假设下具有收敛性。
- 通过函数逼近将鲁棒强化学习扩展至大规模MDP,证明线性与非线性架构下的收敛性。
- 提出均方鲁棒投影贝尔曼误差(MSRPBE)损失函数,以及具有局部收敛保证的随机梯度算法。
提出的方法
- 定义一种鲁棒贝尔曼方程,通过在估计模型周围设定置信区域来考虑转移概率的不确定性。
- 提出鲁棒Q-learning、SARSA与TD-learning算法,利用不确定性集内最坏情况的转移动态来更新值函数。
- 引入均方鲁棒投影贝尔曼误差(MSRPBE)作为函数逼近的损失函数,将MSPBE推广至鲁棒设置。
- 开发用于最小化MSRPBE的随机梯度下降算法,在光滑性与弱假设下保证收敛至局部最小值。
- 在与先前工作相似的技术假设下,证明线性函数逼近器下鲁棒近似策略与值迭代的收敛性。
- 在实验中使用10折交叉验证与线性搜索来调整不确定性集(置信区域)的大小。
实验结果
研究问题
- RQ1能否在仅具有样本而无模型参数的无模型设置下,开发出鲁棒强化学习算法?
- RQ2在模型不匹配条件下,Q-learning、SARSA与TD-learning的鲁棒变体是否能收敛至近似最优策略?
- RQ3在不确定性存在下,使用线性函数逼近的鲁棒近似策略与值迭代能否收敛至良好解?
- RQ4是否存在一种鲁棒损失函数,可推广MSPBE并支持非线性函数逼近设置下的收敛性?
- RQ5在实际中,不确定性集的大小如何影响鲁棒强化学习算法的性能?
主要发现
- 在弱折扣因子假设下,鲁棒Q-learning、SARSA与TD-learning即使在模型误设条件下,也能收敛至近似最优策略。
- 在模型不匹配条件下,标准算法(如普通Q-learning等)可能收敛至远差于最优鲁棒策略的策略。
- 在与先前研究相似的技术假设下,使用线性函数逼近器的鲁棒近似策略与值迭代算法可实现收敛。
- 所提出的MSRPBE损失函数以鲁棒最优策略为局部最小值,且对任意光滑函数逼近器,随机梯度下降可收敛至局部最小值。
- 实验结果表明,鲁棒算法在累积奖励与尾部分布方面优于标准算法,尤其在小到中等程度的模型扰动下表现更优。
- 当不确定性集超出有效概率分布的单纯形时,性能下降,原因在于收敛界中的β值增大。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。