[论文解读] DualSMC: Tunneling Differentiable Filtering and Planning under Continuous POMDPs
DualSMC 提出了一种可微分的、基于粒子的框架,用于连续部分可观察马尔可夫决策过程(POMDP),通过两个顺序蒙特卡洛(SMC)过程联合优化状态滤波与不确定性感知规划:一个用于状态上的信念估计,另一个用于未来轨迹的规划。该方法在具有视觉输入的复杂、部分可观测环境中(包括3D导航和机器人控制)实现了最先进性能,同时通过基于粒子的信念表示和对抗性训练,保持了可解释性。
A major difficulty of solving continuous POMDPs is to infer the multi-modal distribution of the unobserved true states and to make the planning algorithm dependent on the perceived uncertainty. We cast POMDP filtering and planning problems as two closely related Sequential Monte Carlo (SMC) processes, one over the real states and the other over the future optimal trajectories, and combine the merits of these two parts in a new model named the DualSMC network. In particular, we first introduce an adversarial particle filter that leverages the adversarial relationship between its internal components. Based on the filtering results, we then propose a planning algorithm that extends the previous SMC planning approach [Piche et al., 2018] to continuous POMDPs with an uncertainty-dependent policy. Crucially, not only can DualSMC handle complex observations such as image input but also it remains highly interpretable. It is shown to be effective in three continuous POMDP domains: the floor positioning domain, the 3D light-dark navigation domain, and a modified Reacher domain.
研究动机与目标
- 解决在连续POMDP中因状态不确定性显著影响决策质量的局部可观测性规划挑战。
- 开发一种可微分、可解释的框架,通过粒子表示维持对未观测状态的信念,实现鲁棒的推理与规划。
- 通过共享动力学模型和信念传播,整合滤波与规划,提升样本效率与策略性能。
- 在保留基于粒子表示可解释性的前提下,实现复杂观测(如图像)的端到端训练。
- 在具有挑战性的连续POMDP环境(包括视觉导航和机器人控制任务)中进行基准测试,并展示卓越性能。
提出的方法
- DualSMC 使用两个耦合的顺序蒙特卡洛(SMC)过程:一个在真实状态空间中使用粒子进行状态估计滤波,另一个在未来的轨迹空间中进行规划SMC采样。
- 引入一种对抗性粒子滤波器,通过判别器基于观测一致性来优化粒子权重,从而提高滤波精度。
- 规划器使用可微分的Q函数和策略网络,基于预测奖励和状态-动作转移计算轨迹权重,并实现不确定性感知的动作选择。
- 滤波器中选出的最优状态粒子被用作规划器的初始信念,模型通过在每一步重新规划(仅执行第一个动作)实现模型预测控制。
- 滤波与规划共享过渡模型,整个系统通过滤波的监督信号和规划的强化学习信号进行端到端训练。
- 该框架采用信念传播机制,通过粒子权重和状态转移将滤波器与规划器关联,实现不确定性感知的决策。
实验结果
研究问题
- RQ1可微分的、基于粒子的滤波方法是否能提升在复杂观测(如图像)下的连续POMDP中的状态估计性能?
- RQ2如何通过基于粒子的信念表示使连续POMDP中的规划具备不确定性感知能力?
- RQ3对抗性训练能否提升在部分可观测环境中可微分粒子滤波器的鲁棒性与准确性?
- RQ4共享动力学模型在联合滤波与规划中能在多大程度上提升样本效率与性能?
- RQ5在连续控制任务中,DualSMC框架相较于现有深度强化学习与POMDP方法,在性能与可解释性方面表现如何?
主要发现
- DualSMC 在三个连续POMDP基准任务中均达到最先进性能:地板定位任务、3D明暗导航任务,以及修改后的Reacher环境。
- 在涉及丰富视觉观测和长时程部分可观测性的3D明暗导航任务中,该模型显著优于现有方法。
- 对抗性粒子滤波器相比标准可微分粒子滤波器,显著提升了信念估计的准确性,尤其在高不确定性场景下。
- 将滤波器中选出的最优状态粒子作为规划初始信念,可实现更快收敛与更鲁棒的动作选择。
- 通过每步重新规划的模型预测控制策略,即使在模型不准确的情况下也能确保适应性与稳定性。
- 该框架通过基于粒子的信念状态保持了高度可解释性,支持失败分析与模型调试。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。