Skip to main content
QUICK REVIEW

[论文解读] Memory-based Deep Reinforcement Learning for POMDPs

Lingheng Meng, Rob Gorbet|arXiv (Cornell University)|Feb 24, 2021
Reinforcement Learning in Robotics被引用 5
一句话总结

本文提出LSTM-TD3,一种基于记忆增强的深度强化学习算法,将长短期记忆网络(LSTM)集成到双延迟深度确定性策略梯度(TD3)框架中,以解决部分可观察马尔可夫决策过程(POMDPs)的问题。通过将历史观测和动作整合进循环记忆,LSTM-TD3在观测存在噪声或不完整的情况下显著提升了性能,同时在完全可观测的MDP上仍保持最先进水平。

ABSTRACT

A promising characteristic of Deep Reinforcement Learning (DRL) is its capability to learn optimal policy in an end-to-end manner without relying on feature engineering. However, most approaches assume a fully observable state space, i.e. fully observable Markov Decision Processes (MDPs). In real-world robotics, this assumption is unpractical, because of issues such as sensor sensitivity limitations and sensor noise, and the lack of knowledge about whether the observation design is complete or not. These scenarios lead to Partially Observable MDPs (POMDPs). In this paper, we propose Long-Short-Term-Memory-based Twin Delayed Deep Deterministic Policy Gradient (LSTM-TD3) by introducing a memory component to TD3, and compare its performance with other DRL algorithms in both MDPs and POMDPs. Our results demonstrate the significant advantages of the memory component in addressing POMDPs, including the ability to handle missing and noisy observation data.

研究动机与目标

  • 为解决标准深度强化学习(DRL)算法在部分可观察环境中的局限性,这些环境因传感器噪声或感知范围有限而导致状态信息不完整。
  • 开发一种基于记忆的DRL方法,能够从观测和动作历史中推断隐藏状态,从而提升POMDP中的策略学习性能。
  • 评估记忆组件(尤其是基于LSTM的记忆)在连续控制任务的MDP与POMDP版本中的有效性。
  • 研究关键架构组件(如当前特征提取、历史动作引入和记忆压缩)在稳定学习和提升性能方面的贡献。
  • 通过使智能体能够借助记忆推断未观测到的状态动态,为在真实状态不可完全观测时设计观测空间提供洞见。

提出的方法

  • 将长短期记忆(LSTM)网络集成到TD3算法中,以维持编码历史观测和动作的隐藏状态,使智能体能够建模部分可观察环境中的时间依赖性。
  • 采用循环式演员-评论家框架,其中LSTM处理过去观测和动作的序列,隐藏状态用于条件化演员和评论家网络。
  • 将当前观测特征提取(CFE)与记忆表征分离,以减少干扰并提升学习稳定性,尤其在MDP设置中。
  • 应用TD3中的记忆压缩(DC)和目标策略平滑(TPS)以稳定训练并缓解Q值估计中的过度估计偏差。
  • 采用混合架构,其中当前观测和动作独立处理后,再与LSTM隐藏状态拼接,用于策略和价值预测。
  • 将历史长度 $ l $ 固定为每项实验的超参数,尽管未来工作应探索动态自适应以提升效率和性能。

实验结果

研究问题

  • RQ1与标准DRL算法相比,将LSTM记忆组件集成到TD3中,在POMDP上的性能提升程度如何?
  • RQ2当前特征提取、历史动作引入和记忆压缩在LSTM-TD3框架整体性能中的相对贡献是什么?
  • RQ3LSTM-TD3是否能在MDP上保持强劲性能,同时在可观测性退化的POMDP上显著优于基线模型?
  • RQ4当真实状态未被观测完全捕捉时,LSTM-TD3对观测空间设计不确定性的鲁棒性如何?
  • RQ5在动作历史具有信息量的任务中,将历史动作纳入记忆在多大程度上提升了状态推断能力?

主要发现

  • LSTM-TD3在连续控制任务的POMDP版本中显著优于DDPG、TD3及其他基线模型,尤其在观测存在噪声或不完整的情况下表现更优。
  • 消融实验确认,所有组件——当前特征提取(CFE)、记忆压缩(DC)、目标策略平滑(TPS)和历史动作引入(PA)——对最优性能均不可或缺。
  • LSTM-TD3在MDP版本的任务中也优于DDPG,表明记忆组件在完全可观测设置下不会降低性能。
  • 移除当前特征提取(Full - CFE)导致性能显著下降,尤其在MDP中,表明CFE在观测空间设计良好时对维持性能至关重要。
  • 在POMDP-RV版本中(如InvertedDoublePendulumPyBulletEnv-v0)排除历史动作(Full - PA)导致性能明显下降,表明历史动作携带了有用的与状态相关的信息。
  • LSTM-TD3对观测设计不确定性表现出鲁棒性,适用于真实机器人应用,其中观测空间的完整性通常未知。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。