Skip to main content
QUICK REVIEW

[论文解读] Simulation Results on Selector Adaptation in Behavior Trees

Blake Hannaford, Danying Hu|arXiv (Cornell University)|Jun 29, 2016
Artificial Intelligence in Games参考文献 5被引用 14
一句话总结

本文提出了一种自适应行为树(BT)选择器节点,其能够基于传感器条件化的成功概率学习并重新排序子行为,显著提升任务性能。仿真结果表明,将频率学成功概率估计条件化于传感器特征,优于静态或贪婪选择策略,且贪婪选择器需经过前期训练才能有效。

ABSTRACT

Behavior trees (BTs) emerged from video game development as a graphical language for modeling intelligent agent behavior. However as initially implemented, behavior trees are static plans. This paper adds to recent literature exploring the ability of BTs to adapt to their success or failure in achieving tasks. The "Selector" node of a BT tries alternative strategies (its children) and returns success only if all of its children return failure. This paper studies several means by which Selector nodes can learn from experience, in particular, learn conditional probabilities of success based on sensor information, and modify the execution order based on the learned iformation. Furthermore, a "Greedy Selector" is studied which only tries the child having the highest success probability. Simulation results indicate significantly increased task performance, especially when frequentist probability estimate is conditioned on sensor information. The Greedy selector was ineffective unless it was preceded by a period of training in which all children were exercised.

研究动机与目标

  • 通过基于经验实现自适应,提升机器人任务中行为树(BT)选择器节点的性能。
  • 探究基于传感器信息对成功概率估计进行条件化是否能提升BT任务性能。
  • 评估仅优先选择最高概率子节点的贪婪选择器的有效性。
  • 确定在何种条件下自适应选择器优于静态或未经训练的选择器,特别是在复杂任务中。
  • 探讨训练阶段在实现有效贪婪选择器行为中的作用。

提出的方法

  • 本文建模了选择器节点,使其基于学习到的成功概率动态重新排序子行为,使用频率学估计 $ P_{Si} = \frac{\#\text{successes}}{T_i} $。
  • 成功概率基于从传感器数据导出的离散特征向量 $ F(t) $ 条件化,实现上下文感知的重新排序。
  • 系统评估了多种重新排序策略:按 $ P(S) $、$ P(S|F) $、成本和效用排序,其中效用以负成本衡量。
  • 实现了一种贪婪选择器,仅在训练阶段后选择估计成功概率最高的子节点。
  • 在两个任务上进行仿真:地形导航和灭火任务,性能通过平均步数、成本、失败次数和效用进行衡量。
  • 通过奇异值分解或向量量化等技术降低特征空间维度,以改善成功/失败行为的聚类效果。

实验结果

研究问题

  • RQ1基于传感器导出特征对成功概率估计进行条件化,能否提升行为树选择器的性能?
  • RQ2仅选择最高概率子节点的贪婪选择器,与其它自适应策略相比表现如何?
  • RQ3预训练阶段对贪婪选择器有效性有何影响?
  • RQ4在复杂任务中,基于成本或效用的重新排序策略与基于概率的重新排序策略相比如何?
  • RQ5基于传感器的条件化概率估计是否能带来比静态或未经训练选择器更稳健高效的任务完成效果?

主要发现

  • 在地形导航任务中,基于传感器信息的条件化成功概率估计($ P(S|F) $)实现了最低的平均步数(18步)和最佳性能。
  • 经过预训练的贪婪选择器(S2g25)在灭火任务中表现最佳,平均仅需167步,优于所有其他选择器。
  • 未经训练的贪婪选择器表现极差,在灭火任务中平均达900步,失败率100%,凸显了训练阶段的必要性。
  • 在灭火场景中,将 walk_limit 从120增加到150,使飞行转换次数从57%降至0%,但平均成本增加了196步,原因是飞行动作更昂贵。
  • 基于效用或成本排序的选择器表现劣于基于 $ P(S|F) $ 的重新排序策略,尤其是在负成本模式下,表明线性效用度量可能与性能优化不完全匹配。
  • “傻瓜选择器”(固定顺序)始终表现最差,在地形任务中平均228步,平均成本245,显著低于所有自适应策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。