Skip to main content
QUICK REVIEW

[论文解读] Robust Reinforcement Learning in POMDPs with Incomplete and Noisy Observations

Yuhui Wang, Hao He|arXiv (Cornell University)|Feb 15, 2019
Machine Learning and ELM参考文献 13被引用 9
一句话总结

本文提出 BI-PPO,一种在部分可观察马尔可夫决策过程(POMDP)中具有不完整和噪声观测的连续控制任务下的鲁棒强化学习方法。它使用带有局部近似的代理损失,从受损数据中学习转移模型,并将生成模型整合到信念更新中以实现信念补全,在高噪声和缺失数据率下显著优于基线方法,尤其在 HalfCheetah 和 Ant 等高维任务中表现突出。

ABSTRACT

In real-world scenarios, the observation data for reinforcement learning with continuous control is commonly noisy and part of it may be dynamically missing over time, which violates the assumption of many current methods developed for this. We addressed the issue within the framework of partially observable Markov Decision Process (POMDP) using a model-based method, in which the transition model is estimated from the incomplete and noisy observations using a newly proposed surrogate loss function with local approximation, while the policy and value function is learned with the help of belief imputation. For the latter purpose, a generative model is constructed and is seamlessly incorporated into the belief updating procedure of POMDP, which enables robust execution even under a significant incompleteness and noise. The effectiveness of the proposed method is verified on a collection of benchmark tasks, showing that our approach outperforms several compared methods under various challenging scenarios.

研究动机与目标

  • 解决在真实世界连续控制环境中,观测动态不完整或受噪声污染时训练鲁棒强化学习智能体的挑战。
  • 开发一种基于模型的方法,在缺失或噪声传感器输入下仍能保持准确的信念状态,避免依赖完整观测。
  • 在标准 PPO 和基于 RNN 的方法在观测污染下失效的高维控制任务中,提升样本效率和性能。
  • 通过将生成模型整合到信念状态更新中,实现稳定可靠的策略学习,确保在显著数据不完整情况下的鲁棒执行。

提出的方法

  • 提出一种新颖的代理损失函数,结合局部近似,以从不完整和噪声观测中估计 MDP 转移模型,实现鲁棒的动力学学习。
  • 引入一种信念补全机制,利用生成模型在训练和推理过程中预测缺失的状态分量。
  • 将生成模型无缝集成到 POMDP 信念更新过程中,使策略能够基于从历史观测和动作中推导出的优化信念状态进行决策。
  • 在类似 PPO 的算法框架中采用基于模型的范式(BI-PPO),通过补全的信念状态联合训练策略、价值函数和转移模型。
  • 将信念状态作为策略网络的输入,表示潜在状态的后验分布,该信念状态通过生成模型和观测数据递归更新。
  • 在代理损失中应用局部近似,以处理非独立同分布和受损观测,提升学习转移动力学过程中的泛化性和稳定性。

实验结果

研究问题

  • RQ1当观测动态不完整且存在噪声时,基于模型的强化学习方法是否能在 POMDP 中实现鲁棒性能?
  • RQ2通过生成模型进行信念补全,相较于简单补全或直接从受损观测中采取动作,能否显著提升策略性能?
  • RQ3所提出的带有局部近似的代理损失在从不完整和噪声数据中学习转移模型方面,改善程度如何?
  • RQ4通过信念补全联合学习转移模型和策略,是否能带来比标准 PPO 或基于 RNN 的基线方法更好的样本效率和最终性能?

主要发现

  • 在 HalfCheetah、Ant、Hopper 和 Walker2d 任务中,BI-PPO 在高缺失率和高噪声条件下,显著优于 EI-PPO、DR-PPO 和 ADR-PPO,尤其在高维控制任务中表现突出。
  • 在 HalfCheetah 和 Ant 任务中,BI-PPO 分别达到原始 PPO 最大回合奖励的 268% 和 120%,展现出显著的性能提升。
  • BI-PPO 展现出优越的样本效率,在 HalfCheetah、Hopper、InvertedDoublePendulum 和 Reacher 任务中,达到目标性能阈值所需的时间步数少于 PPO 和 EI-PPO。
  • 补全状态的精度(以与真实潜在状态的均方误差衡量)与奖励性能强相关,验证了信念补全机制的有效性。
  • 尽管执行时间复杂度为 O(T(D(1−η))³),但 BI-PPO 平均每轮运行时间为 5.1 秒,考虑到其鲁棒性和性能增益,该开销可接受。
  • 当 50% 的观测缺失或被污染时,BI-PPO 仍能保持强劲性能,而其他方法(包括 DR-PPO 和 ADR-PPO)在该条件下显著退化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。