[论文解读] Nested Reasoning About Autonomous Agents Using Probabilistic Programs
本文提出一种基于嵌套概率编程的规划-推理框架,使自主智能体能够在高不确定性追逃博弈中执行心理理论推理。通过将追击者与逃逸者建模为基于概率条件的智能体,并利用嵌套重要性采样相互模拟对方的推理过程,该方法实现了理性、反规划行为,并通过在不同推理层级间最优分配计算预算,降低了估计器方差。
As autonomous agents become more ubiquitous, they will eventually have to reason about the plans of other agents, which is known as theory of mind reasoning. We develop a planning-as-inference framework in which agents perform nested simulation to reason about the behavior of other agents in an online manner. As a concrete application of this framework, we use probabilistic programs to model a high-uncertainty variant of pursuit-evasion games in which an agent must make inferences about the other agents' plans to craft counter-plans. Our probabilistic programs incorporate a variety of complex primitives such as field-of-view calculations and path planners, which enable us to model quasi-realistic scenarios in a computationally tractable manner. We perform extensive experimental evaluations which establish a variety of rational behaviors and quantify how allocating computation across levels of nesting affects the variance of our estimators.
研究动机与目标
- 开发一种框架,使自主智能体能够在部分可观察、高不确定性的环境中推理其他智能体的意图与计划。
- 以时间依赖的方式建模心理理论,支持在在线决策过程中对他人信念与行为进行递归推理。
- 评估在嵌套推理层级之间分配计算预算对期望效用估计器方差与检测性能的影响。
- 证明在追逃任务中,嵌套贝叶斯推理相较于非嵌套模型能产生更理性和更有效的行为。
提出的方法
- 采用规划-推理方法,将追击者与逃逸者智能体建模为概率程序,分别通过最大化检测可能性与最小化检测可能性进行条件化。
- 利用嵌套重要性采样对多层级智能体推理执行递归推断,实现在连续动作空间下的可处理在线规划。
- 将半真实感的确定性原语(如RRT路径规划器与基于等视域的视野计算)集成到概率模型中。
- 使用基于不来梅市点云数据生成的粗粒度多边形城市地图,模拟真实的环境约束。
- 采用有效样本量(ESS)归一化方法,评估在不同时间点与预算配置下重要性采样权重的方差。
- 通过在不同计算预算(K, L)下进行大量仿真,评估估计器稳定性与性能之间的权衡。
实验结果
研究问题
- RQ1在部分可观察、高不确定性的环境中,自主智能体如何对其他智能体的计划执行嵌套推理?
- RQ2在不同嵌套推理层级之间分配计算资源,对期望效用估计器方差有何影响?
- RQ3相较于非嵌套模型,嵌套贝叶斯推理是否能在追逃博弈中产生更理性和更有效的行为?
- RQ4在真实、连续动作的追逃设定中,模型复杂度与推理质量如何影响检测率?
主要发现
- 嵌套概率编程框架成功在追击者与逃逸者智能体中生成理性、反规划行为,追击者能根据推断的逃逸者意图调整策略。
- 将推理层级扩展至包含对推理本身的推理,显著提升了检测率,相较于非嵌套模型表现更优。
- 追击者权重的有效样本量(ESS)随时间推移而增加,表明当检测概率趋近于任务末期时,推理难度降低。
- 当更多样本被分配给最外层(追击者)模型时,期望效用估计器的方差更低,尤其在(K,L)=(16,128)等配置下,显示出更优的估计器鲁棒性。
- 追击者的对数平均权重随时间下降,符合预期,反映了检测概率的降低,而逃逸者的权重则保持相对稳定。
- 箱线图分析表明,较低的K值与较高的L值能产生更鲁棒的对数权重,且异常值更少,支持将更多计算资源分配给外层模型的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。