Skip to main content
QUICK REVIEW

[论文解读] Probabilistic programs for inferring the goals of autonomous agents

Marco Cusumano-Towner, Alexey Radul|arXiv (Cornell University)|Apr 17, 2017
AI-based Problem Solving and Planning参考文献 14被引用 8
一句话总结

本文提出了一种概率编程框架,利用随机路径规划算法作为生成模型,推断自主智能体的目标。该框架引入了无需似然度的蒙特卡洛推断技术——级联重模拟与基于神经网络似然估计的嵌套推断,实现了在复杂环境中高效、可扩展的目标推断,每个示例仅需不到50行代码。

ABSTRACT

Intelligent systems sometimes need to infer the probable goals of people, cars, and robots, based on partial observations of their motion. This paper introduces a class of probabilistic programs for formulating and solving these problems. The formulation uses randomized path planning algorithms as the basis for probabilistic models of the process by which autonomous agents plan to achieve their goals. Because these path planning algorithms do not have tractable likelihood functions, new inference algorithms are needed. This paper proposes two Monte Carlo techniques for these "likelihood-free" models, one of which can use likelihood estimates from neural networks to accelerate inference. The paper demonstrates efficacy on three simple examples, each using under 50 lines of probabilistic code.

研究动机与目标

  • 为解决在真实场景中,从部分运动观测中推断自主智能体未观测到的目标这一挑战。
  • 克服传统最优控制和基于MDP方法的局限性,这些方法需要大量任务特定工程工作,且可扩展性差。
  • 通过将智能体建模为执行随机路径规划器,将其视为黑箱组件,实现可扩展、灵活的目标推断。
  • 为具有复杂、遗留或优化路径规划器导致的不可计算似然度的模型,开发高效的推断算法。
  • 证明简短的概率程序(少于50行)可在多种场景中实现有意义的目标推断,包括人类运动和多智能体协同。

提出的方法

  • 使用随机路径规划算法(例如基于RRT的智能体路径)作为智能体行为的生成过程,实现对复杂环境的高效探索。
  • 将现有的、优化的或遗留的路径规划器视为黑箱函数,避免将其重写为概率编程语言。
  • 提出级联重模拟的马尔可夫链蒙特卡洛方法(MH),这是一种无需似然度的MCMC方法,通过联合提出内部随机选择以消除未知似然度。
  • 提出使用神经网络估计似然度的嵌套推断,使高级蒙特卡洛和变分推断技术得以应用。
  • 在Venture平台中使用分层概率程序来建模复杂的目标先验、部分观测环境和多智能体交互。
  • 利用概率编程构造统一建模与推断,适用于多样化的目标推断问题,且代码量极小。

实验结果

研究问题

  • RQ1概率程序能否有效利用快速随机路径规划器作为生成模型来建模目标导向行为?
  • RQ2当路径规划器的内部随机选择导致似然度不可计算时,如何实现高效推断?
  • RQ3能否使用神经网络估计无需似然度模型中的似然度以加速推断?
  • RQ4简短的概率程序(少于50行)在真实场景中能实现多高程度的准确目标推断?
  • RQ5在自然运动序列中,推断出的目标共享概率与人类判断相比如何?

主要发现

  • 级联重模拟MH算法通过联合提出内部随机选择,成功在无需似然度的模型中执行推断,实现了有效的MCMC采样。
  • 使用神经网络似然估计的嵌套推断使高级推断技术得以应用,显著加速了复杂模型中的收敛。
  • 对于简短的人类运动序列,模型估计出共同目标的概率为63%,在延长序列中提升至82%,表明数据越多,置信度越高。
  • 人类对目标共享可能性的判断与模型推断结果在定性上一致,表明与人类直觉推理相符。
  • 该框架在三种不同场景中均实现了有效目标推断——单智能体导航、多智能体协同和人类运动——每个场景仅使用不到50行概率代码。
  • 该方法可扩展至复杂环境,通过统一的概率编程接口支持分层目标先验、部分观测地图和多智能体交互。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。