Skip to main content
QUICK REVIEW

[论文解读] XLVIN: eXecuted Latent Value Iteration Nets

Andreea Deac, Petar Veličković|arXiv (Cornell University)|Oct 25, 2020
Reinforcement Learning in Robotics参考文献 47被引用 6
一句话总结

XLVINs 提出了一种新颖的隐式规划框架,通过结合对比自监督学习、图神经网络和神经算法推理,将价值迭代网络(VINs)推广至连续、未知或不规则的马尔可夫决策过程(MDPs)。该模型在无需已知环境动态的情况下,于潜在空间中执行价值迭代,其性能超越了模型无关基线方法,并在离散 MDP 上达到与 VIN 相当的水平,尤其在低数据场景下表现优异。

ABSTRACT

Value Iteration Networks (VINs) have emerged as a popular method to incorporate planning algorithms within deep reinforcement learning, enabling performance improvements on tasks requiring long-range reasoning and understanding of environment dynamics. This came with several limitations, however: the model is not incentivised in any way to perform meaningful planning computations, the underlying state space is assumed to be discrete, and the Markov decision process (MDP) is assumed fixed and known. We propose eXecuted Latent Value Iteration Networks (XLVINs), which combine recent developments across contrastive self-supervised learning, graph representation learning and neural algorithmic reasoning to alleviate all of the above limitations, successfully deploying VIN-style models on generic environments. XLVINs match the performance of VIN-like models when the underlying MDP is discrete, fixed and known, and provides significant improvements to model-free baselines across three general MDP setups.

研究动机与目标

  • 为克服价值迭代网络(VINs)的局限性,后者要求已知、离散且固定的 MDP,且缺乏明确的规划激励。
  • 实现在潜在状态空间未显式定义或存储的连续或未知 MDP 中的隐式规划。
  • 设计一个在不同环境中均具备鲁棒性与可迁移性的规划模块,即使在合成的、非对齐图上进行训练亦可。
  • 将神经算法推理与自监督表示学习相结合,引导模型在潜在空间中执行价值迭代。

提出的方法

  • 通过 TransE 风格的状态和动作嵌入,利用对比自监督学习从原始观测中推断环境动态,无需真实 MDP。
  • 采用具有消息传递机制的图神经网络(GNN),在潜在空间中遍历部分推断的 MDP,实现在不规则或连续状态空间上的规划。
  • 引入一种可微、可学习的价值迭代执行器,其结构模仿贝尔曼备份,确保与价值迭代的算法行为一致。
  • 利用通过对比目标训练的潜在转移模型,保留状态之间的结构关系,从而在嵌入空间中实现精确规划。
  • 将规划模块与策略网络(PPO)结合,联合优化规划与控制,实现模型自由与基于模型信号的稳健融合。
  • 使用策略梯度方法端到端训练整个系统,规划模块通过算法归纳偏差隐式学习解决长时程任务。

实验结果

研究问题

  • RQ1在转移动态未预先提供的连续或未知 MDP 中,隐式规划能否被有效推广?
  • RQ2如何训练神经网络在未显式访问 MDP 结构的情况下,于潜在空间中执行价值迭代?
  • RQ3在缺乏真实环境动态的情况下,自监督动态模型在多大程度上能支持有效规划?
  • RQ4神经算法推理的使用是否能提升规划模块在多样化环境中的鲁棒性与可迁移性?
  • RQ5XLVINs 是否能在模型自由基线失效的低数据场景下保持性能?

主要发现

  • XLVINs 在如网格世界等离散、已知 MDP 上的性能与标准 VINs 相当,表明该方法保留了价值迭代的归纳偏差。
  • 在连续状态环境(如 CartPole、Acrobot 和 MountainCar)中,XLVINs 显著优于模型自由 PPO 基线,甚至超越依赖显式标量值预测的 ATreeC。
  • 在 Atari 环境中,XLVINs 在前 500,000 次转移中持续优于 ATreeC 和 PPO 基线,尤其在低数据场景下表现更优。
  • 该模型的规划执行器具备跨环境泛化能力,能从随机生成图的训练成功迁移至真实世界任务(如 Enduro 和迷宫导航)。
  • 定性分析表明,XLVINs 学习将潜在状态嵌入重新组织,以反映与目标的最短路径接近程度,表明其在潜在空间中实现了有效规划。
  • 消融研究证实,基于像素的世界模型无法支持 XLVINs,而基于标量值的规划器(如 ATreeC)表现欠佳,凸显了基于潜在空间图的规划模块的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。