[论文解读] Petri Net Machines for Human-Agent Interaction
本文提出了佩特里网机器(Petri Net Machines, PNM),一种使用佩特里网构建确定性有限状态机的正式框架,以实现人类-智能体交互任务的可靠并发执行。结果表明,PNM 支持交错任务执行、自然语言交互以及 ROS 集成,并已在芬兰一家购物中心成功部署,机器人在处理中断和社交对话的同时准确提供了导航指引。
Smart speakers and robots become ever more prevalent in our daily lives. These agents are able to execute a wide range of tasks and actions and, therefore, need systems to control their execution. Current state-of-the-art such as (deep) reinforcement learning, however, requires vast amounts of data for training which is often hard to come by when interacting with humans. To overcome this issue, most systems still rely on Finite State Machines. We introduce Petri Net Machines which present a formal definition for state machines based on Petri Nets that are able to execute concurrent actions reliably, execute and interleave several plans at the same time, and provide an easy to use modelling language. We show their workings based on the example of Human-Robot Interaction in a shopping mall.
研究动机与目标
- 解决传统有限状态机(FSMs)在建模复杂、并发的人机交互方面的局限性。
- 通过提供一种知识驱动、专家标注的替代方案,克服强化学习在人机交互中对大量数据的需求。
- 实现社会机器人中交错的物理动作与对话动作(如指向、说话、确认理解)的可靠执行。
- 提供一种形式化、可验证且可扩展的状态机建模语言,支持并发、循环和恢复行为。
- 开发一种原生兼容 ROS 和动作服务器的系统,为 SMACH 等框架提供实用的替代方案。
提出的方法
- 使用基于 YAML 和 PDDL 风格语法的领域特定标记语言来定义动作、先决条件和效果,以建模交互逻辑。
- 实现基于佩特里网的执行引擎,保证无不可达状态,并支持多个佩特里网机器(PNMs)的并发执行。
- 与 ROS 动作服务器集成,实现在执行过程中与机器人系统和外部知识库的无缝交互。
- 基于动作的先决条件和后置条件自动生成恢复行为和检查机制,以提升鲁棒性。
- 支持任务中断与恢复,允许对话或新任务与正在进行的物理任务交错执行。
- 采用混合执行模型:社交对话由外部系统管理,而物理任务执行则由 PNM 协调。
实验结果
研究问题
- RQ1佩特里网机器能否可靠地建模并执行人机交互中的并发物理动作与对话动作?
- RQ2PNM 在人机交互中,尤其是在交错社交对话时,处理任务中断与恢复的效率如何?
- RQ3与现有基于 FSM 的系统(如 SMACH)相比,PNM 框架在表达能力、并发性和可维护性方面优势有多大?
- RQ4PNM 的建模语言是否可在无需底层编程的情况下有效使用,使非专家开发者也能构建复杂交互行为?
- RQ5该系统在真实世界、非受控环境(如公共购物中心)中的表现如何?
主要发现
- 在全部 5 次客户互动和开发者测试中,系统均能正确触发、暂停并恢复目标任务,中断后仍能可靠恢复,证明了任务恢复的鲁棒性。
- 系统成功协调了在指路过程中同时进行的言语描述、指向和眼神交流等动作,保持了时间与语义的一致性。
- PNM 框架实现了对话任务(如讨论喜爱的书籍)与物理任务(如提供导航指引)的无缝交错,任务状态未发生丢失。
- 系统基于动作的先决条件和效果自动生成恢复行为,提升了执行稳定性,无需手动编码。
- 采用基于 YAML 的标记语言使得状态机的规格说明直观且人类可读,无需深入编程知识即可完成。
- 在芬兰购物中心为期 5 天的实地部署观察数据表明,PNM 在真实环境下正确执行了任务,包括用户发起的中断和动态输入。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。