[论文解读] Stick-Breaking Policy Learning in Dec-POMDPs
本文提出Dec-SBPR,一种基于狄利克雷过程的非参数贝叶斯框架,用于在去中心化部分可观察马尔可夫决策过程(Dec-POMDPs)中学习可变大小的有限状态控制器(FSCs),通过棒棒糖先验自动确定最优控制器复杂度。该方法在离线轨迹数据上应用变分贝叶斯算法,实现可扩展的高性能策略学习,无需依赖完整的Dec-POMDP模型,并在基准问题上优于固定大小FSC方法。
Expectation maximization (EM) has recently been shown to be an efficient algorithm for learning finite-state controllers (FSCs) in large decentralized POMDPs (Dec-POMDPs). However, current methods use fixed-size FSCs and often converge to maxima that are far from optimal. This paper considers a variable-size FSC to represent the local policy of each agent. These variable-size FSCs are constructed using a stick-breaking prior, leading to a new framework called \emph{decentralized stick-breaking policy representation} (Dec-SBPR). This approach learns the controller parameters with a variational Bayesian algorithm without having to assume that the Dec-POMDP model is available. The performance of Dec-SBPR is demonstrated on several benchmark problems, showing that the algorithm scales to large problems while outperforming other state-of-the-art methods.
研究动机与目标
- 为解决在Dec-POMDPs中选择最优固定大小有限状态控制器(FSC)的挑战,该问题常因参数不足或过度参数化而导致次优策略。
- 开发一种可扩展的、无模型的学习框架,通过贝叶斯非参数方法自动确定合适的FSC规模。
- 仅使用动作、观测和奖励的离线轨迹数据,无需访问底层模型,实现在大规模Dec-POMDPs中的高效策略学习。
- 通过基于数据驱动的后验推断动态调整控制器复杂度,提升收敛速度与策略质量。
提出的方法
- 使用棒棒糖先验构建可变大小的FSC,使活跃状态数量由学习过程中的后验分布决定。
- 应用变分贝叶斯(VB)推断算法,直接从基于代理轨迹推导出的经验价值函数估计FSC参数。
- 在偏移的经验价值函数上操作,避免了先前规划即推理框架中使用的动态贝叶斯网络复杂似然建模。
- 通过修改的Baum-Welch风格算法,为每个代理递归计算前向和后向消息(α, β),以支持高效的VB更新。
- 通过基于观测到的动作和观测频率更新浓度参数,推导棒棒糖过程的后验超参数。
- 计算复杂度随代理数量线性增长,问题规模最多呈二次增长,支持在大规模Dec-POMDPs中的应用。
实验结果
研究问题
- RQ1贝叶斯非参数方法能否在无需预先指定的情况下,自动确定Dec-POMDPs中有限状态控制器的最优规模?
- RQ2使用棒棒糖先验的可变大小FSC学习方法与固定大小FSC相比,在策略质量与收敛速度方面表现如何?
- RQ3变分贝叶斯算法能否仅基于离线轨迹数据且无需完整模型访问,在Dec-POMDPs中有效学习高质量策略?
- RQ4所提出方法在大规模Dec-POMDP问题上是否具备可扩展性,同时保持或超越现有最先进方法的性能?
主要发现
- Dec-SBPR在多个基准Dec-POMDP问题上优于现有最先进方法,实现了更高的期望累积奖励。
- 该算法在大规模问题上具有高效可扩展性,计算复杂度随代理数量线性增长,问题规模最多呈二次增长。
- 棒棒糖先验可自动发现紧凑而有效的FSC,避免了因固定大小控制器过大而导致的过拟合。
- 与固定大小FSC方法相比,该方法收敛更快且达到更高质量的策略,后者常陷入次优解。
- 实证结果表明,即使固定大小FSC被调优至最优规模,Dec-SBPR学习得到的可变大小FSC仍表现更优。
- 该框架在仅使用动作、观测和奖励轨迹的无模型批量学习设置下,成功学习到高质量策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。