Skip to main content
QUICK REVIEW

[论文解读] Learning Discrete State Abstractions With Deep Variational Inference

Ondřej Bíža, Robert W. Platt|arXiv (Cornell University)|Mar 9, 2020
Reinforcement Learning in Robotics参考文献 25被引用 6
一句话总结

本文提出了一种深度变分推理方法,通过将高维图像状态映射到连续嵌入,再利用动作条件化的隐马尔可夫模型(HMM)进行聚类,从而学习离散状态抽象作为近似MDP双生模拟。关键贡献是一个端到端可训练的框架,可在无需进一步训练的情况下,实现对多目标强化学习中未见目标的高效规划。

ABSTRACT

Abstraction is crucial for effective sequential decision making in domains with large state spaces. In this work, we propose an information bottleneck method for learning approximate bisimulations, a type of state abstraction. We use a deep neural encoder to map states onto continuous embeddings. We map these embeddings onto a discrete representation using an action-conditioned hidden Markov model, which is trained end-to-end with the neural network. Our method is suited for environments with high-dimensional states and learns from a stream of experience collected by an agent acting in a Markov decision process. Through this learned discrete abstract model, we can efficiently plan for unseen goals in a multi-goal Reinforcement Learning setting. We test our method in simplified robotic manipulation domains with image states. We also compare it against previous model-based approaches to finding bisimulations in discrete grid-world-like environments. Source code is available at https://github.com/ondrejba/discrete_abstractions.

研究动机与目标

  • 为解决深度强化学习中常见于高维状态空间的紧凑离散状态抽象学习挑战。
  • 在无需微调的情况下,实现对多目标强化学习设置中未见目标的高效规划。
  • 学习一个保留转移和奖励结构的抽象MDP,形成对原始MDP的近似双生模拟。
  • 克服先前方法的局限性,这些方法要么无法泛化到新任务,要么无法生成离散的、平面化的MDP结构。
  • 将结构化先验(高斯混合模型GMM和HMM)整合到变分信息瓶颈框架中,以实现具有预测性和结构约束的表示学习。

提出的方法

  • 一个深度神经编码器将高维图像状态映射为连续嵌入,保留与决策相关的信息。
  • 通过学习到的动作条件化隐马尔可夫模型(HMM)将连续嵌入映射为离散抽象状态,该模型对时间转移动态进行建模。
  • 该方法使用变分信息瓶颈(VIB)目标,以最大化从抽象状态对Q值的预测,同时最小化编码复杂度。
  • 结构化先验(GMM和HMM)与神经编码器端到端联合训练,其中聚类均值、协方差和转移矩阵构成抽象MDP。
  • HMM先验编码了与动作相关的转移动态,使抽象模型能够表示具有离散状态和转移概率的有效MDP。
  • 提取先验的已学习参数(如聚类均值和转移矩阵)以形成用于规划的离散抽象MDP。

实验结果

研究问题

  • RQ1深度变分推理框架能否在基于图像的高维环境中学习到形成近似MDP双生模拟的离散状态抽象?
  • RQ2所学习的抽象MDP能否在无需训练的情况下,支持对训练期间未见目标的高效规划?
  • RQ3与GMM等简单先验相比,使用动作条件化HMM先验如何提升所学抽象的质量和结构?
  • RQ4该方法是否能泛化到长时程任务,并在分布偏移下保持性能?
  • RQ5该抽象能否在不重新训练的情况下实现策略压缩和迁移?

主要发现

  • 该方法成功学习到形成高质量近似双生模拟的离散抽象,在评估环境中抽象状态最多可达1000个。
  • 所学习的抽象MDP可在无需额外训练或微调的情况下,实现对多目标强化学习中未见目标的高效规划。
  • 在简化机器人操作领域中使用图像状态的实验表明,抽象模型保留了相关决策信息,同时降低了状态空间复杂度。
  • 在离散网格世界类环境中,该方法在学习双生模拟方面优于先前的基于模型方法,尤其在新任务泛化方面表现更优。
  • 与基于GMM的替代方案相比,使用动作条件化HMM先验可生成更具结构化和动态一致性的抽象MDP。
  • 该框架通过学习低维离散表示,实现了深度Q网络策略的压缩,同时保持了策略性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。