[论文解读] Deep Robust Kalman Filter
本文提出 RTD-DQN 和 Deep-RoK 两种算法,用于使用深度神经网络求解大规模鲁棒马尔可夫决策过程(RMDPs)。RTD-DQN 在损失函数中引入鲁棒贝尔曼时序差分误差,以处理转移概率中的不确定性;而 Deep-RoK 在此基础上结合扩展卡尔曼滤波器(EKF),联合建模价值函数权重与转移动态的不确定性,在参数不确定性下的连续控制任务(如 Cart-Pole)中显著提升了鲁棒性。
A Robust Markov Decision Process (RMDP) is a sequential decision making model that accounts for uncertainty in the parameters of dynamic systems. This uncertainty introduces difficulties in learning an optimal policy, especially for environments with large state spaces. We propose two algorithms, RTD-DQN and Deep-RoK, for solving large-scale RMDPs using nonlinear approximation schemes such as deep neural networks. The RTD-DQN algorithm incorporates the robust Bellman temporal difference error into a robust loss function, yielding robust policies for the agent. The Deep-RoK algorithm is a robust Bayesian method, based on the Extended Kalman Filter (EKF), that accounts for both the uncertainty in the weights of the approximated value function and the uncertainty in the transition probabilities, improving the robustness of the agent. We provide theoretical results for our approach and test the proposed algorithms on a continuous state domain.
研究动机与目标
- 解决在具有不确定模型参数的大规模马尔可夫决策过程(MDPs)中学习鲁棒策略的挑战。
- 克服现有 RMDP 方法依赖线性近似、离线估计或对转移概率施加严格假设的局限性。
- 开发在线、非线性函数逼近方法,同时考虑模型参数不确定性与价值函数权重的不确定性。
- 提升智能体在自动驾驶和金融等现实领域中的性能,因为在这些领域中,模型不确定性可能导致灾难性策略失效。
提出的方法
- RTD-DQN 在损失函数中用鲁棒贝尔曼时序差分误差(rBTDe)替代标准贝尔曼时序差分(TD)误差,以最小化转移概率不确定性集上的最坏情况价值函数误差。
- rBTDe 源自鲁棒贝尔曼算子,该算子针对不确定性集中所有可能的转移分布优化最坏情况下的预期回报。
- Deep-RoK 使用扩展卡尔曼滤波器(EKF)对深度 Q-网络的权重执行贝叶斯推断,将价值函数近似中的不确定性建模为多变量正态分布。
- EKF 将来自转移概率集 𝒫 的不确定性传播至权重不确定性集 Θ,实现对模型与函数逼近不确定性的同时估计。
- 该算法维护一个均值权重估计 θ̂t|t 和协方差矩阵 Pt|t,通过使用 rBTDe 作为创新项的 EKF 预测与校正步骤进行更新。
- 最终策略源自最小化在模型与权重不确定性下预期最坏损失的鲁棒价值函数。
实验结果
研究问题
- RQ1当转移概率存在不确定性时,深度强化学习智能体是否能在大规模 MDP 中实现鲁棒性能?
- RQ2将鲁棒时序差分学习与深度神经网络结合,是否能相比标准 DQN 在连续控制任务中提升策略鲁棒性?
- RQ3通过基于 EKF 的贝叶斯框架对转移动态与价值函数权重的不确定性进行建模,是否能提升在参数不匹配情况下的泛化能力?
- RQ4当在极端或未见过的参数值下测试时,鲁棒智能体的性能与名义 DQN 智能体相比如何?
主要发现
- Double-DQN 智能体在其名义训练参数(杆长 0.5 m,小车质量 1.5 kg)下获得了高累计奖励,但在分布外参数值下性能急剧下降。
- RTD-DQN 智能体在不同杆长下表现出一致性能,并在不确定或极端参数值下优于 Double-DQN,这是由于通过 rBTDe 显式建模了转移不确定性。
- Deep-RoK 智能体在广泛范围的杆长(0.2–1.4 m)和小车质量(0.1–7 kg)下均保持高性能,在测试套件中取得了最高成功率。
- Deep-RoK 中的贝叶斯不确定性估计使智能体能够稳健泛化,在多样化的参数组合下,其成功率优于 Double-DQN 和 RTD-DQN。
- 已证明 Deep-RoK 算法最小化了鲁棒 EKF 损失函数,为其提升的鲁棒性提供了理论基础。
- 实证结果证实,同时对模型参数与价值函数权重的不确定性进行建模,可带来在不确定环境中更可靠、更安全的策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。