Skip to main content
QUICK REVIEW

[论文解读] Learning Compact Models for Planning with Exogenous Processes

Rohan Chitnis, Tomás Lozano‐Pérez|arXiv (Cornell University)|Sep 30, 2019
Reinforcement Learning in Robotics参考文献 16被引用 7
一句话总结

本文提出了一种可处理的算法,通过利用互信息选择一组与任务相关的外生变量,从而在具有大外生状态空间的MDP中学习紧凑的规划模型。该方法通过仅关注相关环境变量,实现了高效且高性能的规划,在小规模领域中取得了具有竞争力的回报,并可扩展至模拟机器人操作任务中的大外生状态空间。

ABSTRACT

We address the problem of approximate model minimization for MDPs in which the state is partitioned into endogenous and (much larger) exogenous components. An exogenous state variable is one whose dynamics are independent of the agent's actions. We formalize the mask-learning problem, in which the agent must choose a subset of exogenous state variables to reason about when planning; doing planning in such a reduced state space can often be significantly more efficient than planning in the full model. We then explore the various value functions at play within this setting, and describe conditions under which a policy for a reduced model will be optimal for the full MDP. The analysis leads us to a tractable approximate algorithm that draws upon the notion of mutual information among exogenous state variables. We validate our approach in simulated robotic manipulation domains where a robot is placed in a busy environment, in which there are many other agents also interacting with the objects. Visit http://tinyurl.com/chitnis-exogenous for a supplementary video.

研究动机与目标

  • 解决在状态空间被划分为内生(动作可控)和大规模外生(动作无关)组件的MDP中高效规划的挑战。
  • 形式化定义‘掩码学习问题’——即选择最小的外生变量子集,使得在完整MDP中实现近似最优规划。
  • 识别在奖励和动态非可加分解条件下,于简化模型上优化的策略仍对完整MDP最优的条件。
  • 开发一种可处理且数据高效的算法,利用外生性与互信息识别用于规划的相关外生变量。
  • 在具有动态多智能体交互的模拟机器人环境中验证该方法,展示其可扩展性与性能。

提出的方法

  • 将掩码学习问题形式化为从外生状态变量中选择一个子集以包含在简化MDP模型中,以最小化规划成本,同时保持解决方案质量。
  • 使用外生变量与任务相关动态(如物体位置)之间的互信息作为相关性的代理,实现高效的变量选择。
  • 构建一种贪心的迭代算法,基于其对预测未来动态的信息增益估计,逐个将外生变量加入掩码。
  • 利用外生性假设,仅对所选变量学习转移模型,从而降低模型复杂度与计算时间。
  • 优化一个正则化目标,平衡期望回报与掩码大小,以在不牺牲性能的前提下促进紧凑性。
  • 在使用pybullet进行环境模拟与评估的多智能体模拟机器人操作任务中应用该方法。

实验结果

研究问题

  • RQ1在简化MDP(仅包含部分外生变量)中最优的策略,其在完整MDP中也最优的条件是什么?
  • RQ2如何高效识别出一个最小的外生变量集合,使其在完整MDP中保持高回报,且不假设奖励分解为可加形式?
  • RQ3外生变量之间的互信息能否作为选择相关规划变量的可靠启发式方法?
  • RQ4与不利用外生性的基线方法相比,所提出的算法在大规模外生状态空间中的可扩展性如何?
  • RQ5该算法能否为不同任务学习不同的掩码,以反映外生动态在任务中的特定相关性?

主要发现

  • 所提出的算法学习到的掩码在小规模领域中与完整模型规划相比,实现了具有竞争力的回报,尽管进行了模型简化,性能损失极小。
  • 该方法优于不利用外生性或动态相关性的基线策略,尤其在高维外生状态环境中表现更优。
  • 该算法成功学习了任务特定的掩码:对于涉及不可操作物体的任务,它会忽略其他智能体的状态;对于可操作物体,则包含相关智能体的状态。
  • 所学习的掩码反映了直观的任务依赖关系——例如,排除无关环境区域,聚焦于影响物体动态的智能体。
  • 该方法可扩展至大规模外生状态空间,在完整规划不可行时仍保持效率与性能。
  • 该算法的贪心掩码扩展策略有效,但受限于顺序选择;未来工作可探索联合变量选择以提升预测能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。