[论文解读] Information Gathering in Decentralized POMDPs by Policy Graph Improvement
本文提出了首个针对具有凸奖励函数的去中心化部分可观察马尔可夫决策过程(Dec-POMDPs)的启发式算法,特别针对信息收集任务。通过证明当奖励函数为凸时,联合信念下的价值函数亦为凸,作者推导出一个下界以加速策略图的改进,从而在保持高质量策略的同时,将可解决的问题规模扩大了一个数量级。
Decentralized policies for information gathering are required when multiple autonomous agents are deployed to collect data about a phenomenon of interest without the ability to communicate. Decentralized partially observable Markov decision processes (Dec-POMDPs) are a general, principled model well-suited for such decentralized multiagent decision-making problems. In this paper, we investigate Dec-POMDPs for decentralized information gathering problems. An optimal solution of a Dec-POMDP maximizes the expected sum of rewards over time. To encourage information gathering, we set the reward as a function of the agents' state information, for example the negative Shannon entropy. We prove that if the reward is convex, then the finite-horizon value function of the corresponding Dec-POMDP is also convex. We propose the first heuristic algorithm for information gathering Dec-POMDPs, and empirically prove its effectiveness by solving problems an order of magnitude larger than previous state-of-the-art.
研究动机与目标
- 解决多智能体系统中智能体在执行期间无法通信的去中心化信息收集问题。
- 为具有凸奖励的Dec-POMDPs开发一种可扩展的启发式算法,该算法通过信念不确定性建模信息增益。
- 证明当奖励为凸时,价值函数在联合信念下仍保持凸性,将单智能体结果推广至去中心化设置。
- 通过基于推导出的价值下界,对固定大小的策略图进行迭代改进,实现高效的策略搜索。
- 在大规模Dec-POMDPs上对方法进行实证验证,证明其在可扩展性和性能方面优于当前最先进基线方法。
提出的方法
- 该方法将信息收集建模为一种基于联合信念负香农熵的Dec-POMDP,该函数为凸函数。
- 证明若奖励在联合信念上为凸,则任意策略的有限horizon价值函数在联合信念上亦为凸。
- 提出一种基于凸性的新颖价值函数下界,用于剪枝次优的策略图改进。
- 采用迭代策略图改进(NPGI),通过局部策略更新在时间步上对固定大小的策略图进行优化。
- 算法的反向传播阶段使用该下界加速收敛,同时不降低解的质量。
- 该算法应用于每个时间步固定大小的策略图,兼顾表达能力与计算可行性。
实验结果
研究问题
- RQ1当奖励为联合信念的凸函数时,Dec-POMDP的价值函数是否仍保持在联合信念上的凸性?
- RQ2能否利用基于凸性的下界来加速Dec-POMDP中启发式策略搜索,而不牺牲解的质量?
- RQ3所提出的启发式算法是否能比以往方法扩展到更大规模的Dec-POMDPs,特别是在信息收集场景中?
- RQ4在现实的多智能体信息收集领域中,该方法的性能如何随策略图大小和horizon长度变化?
- RQ5使用下界是否能有效减少策略改进过程的运行时间,同时保持高策略价值?
主要发现
- 当奖励在信念上为凸时,有限horizon Dec-POMDP的价值函数在联合信念上保持凸性,推广了单智能体POMDP中已知的结果。
- 所提出的启发式算法NPGI结合下界,在信息收集场景的Dec-POMDP中,解决了比以往最先进方法大一个数量级的问题。
- 在MAV领域中,该方法在不同策略图大小和horizon下均保持一致的高策略价值,且使用下界时性能下降极小。
- 在火星车(rover)领域中,该方法优于DICEPS、JESP和GMAA*-ICE等基线方法,使用下界时性能无显著下降。
- 对于较长horizon(T ≥ 4),下界将反向传播的运行时间减少最多达50%,在T=5时收益最大(例如,有下界时为55.34秒,无下界时为158.7秒)。
- 即使采用仅每时间步2个节点的紧凑策略图,该方法也能实现接近最优的性能,表明其具有高度的效率与可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。