Skip to main content
QUICK REVIEW

[论文解读] Real-time tree search with pessimistic scenarios

Takayuki Osogami, Toshihiro Takahashi|arXiv (Cornell University)|Feb 28, 2019
Robotic Path Planning Algorithms参考文献 36被引用 11
一句话总结

本文提出了一种实时树搜索方法,通过在指定搜索深度之外使用确定性、悲观的场景,实现在严格时间约束下的长时域规划。通过在悲观未来中消除分支,该方法能高效评估远距离关键事件下的行动表现——在使用自我对弈优化后,该方法在NeurIPS 2018 Pommerman竞赛中获得第一名和第三名,对基线智能体的胜率高达99.7%。

ABSTRACT

Autonomous agents need to make decisions in a sequential manner, under partially observable environment, and in consideration of how other agents behave. In critical situations, such decisions need to be made in real time for example to avoid collisions and recover to safe conditions. We propose a technique of tree search where a deterministic and pessimistic scenario is used after a specified depth. Because there is no branching with the deterministic scenario, the proposed technique allows us to take into account the events that can occur far ahead in the future. The effectiveness of the proposed technique is demonstrated in Pommerman, a multi-agent environment used in a NeurIPS 2018 competition, where the agents that implement the proposed technique have won the first and third places.

研究动机与目标

  • 解决在部分可观测、多智能体环境中存在严格时间约束的实时序列决策问题。
  • 在分支因子大且计算时间有限的情况下,实现有效的长期规划。
  • 通过在搜索深度之外模拟确定性、悲观的未来,提升安全关键场景下的决策质量。
  • 通过自我对弈优化悲观程度,以在竞争性多智能体环境中实现性能与鲁棒性的平衡。

提出的方法

  • 该方法将树搜索进行到指定深度,然后在假设对手同时采取多个不利行动的确定性、悲观场景下评估叶节点。
  • 悲观场景虽不现实,但通过允许多个智能体以非随机但确定的顺序行动,捕捉了关键未来事件(如炸弹爆炸和对手攻击)。
  • 通过将场景视为确定性,避免在搜索深度之外进行分支,从而在实时约束下实现对长期后果的更深层次探索。
  • 悲观程度通过自我对弈进行调优,即在不同悲观程度下评估智能体表现,以识别最优设置。
  • 该方法在两个Pommerman智能体——HakozakiJunctions和dypm-final中实现,均采用此树搜索策略并优化了悲观程度。

实验结果

研究问题

  • RQ1在严格时间约束下,确定性、悲观的场景是否能实现实时树搜索中的有效长时域规划?
  • RQ2在具有部分可观测性和同时行动的多智能体环境中,悲观程度如何影响性能?
  • RQ3当计算时间严重受限时,悲观场景是否能优于随机采样?
  • RQ4自我对弈是否是优化悲观程度以在竞争环境中最大化整体性能的有效方法?

主要发现

  • 使用悲观程度为3的dypm智能体对SimpleAgent基线的胜率为99.7%,在1,000场比赛中赢下997场。
  • 将悲观程度从0提升至3,使对SimpleAgent的胜率从92.6%提升至99.7%,显示出显著的性能提升。
  • 在面对更强基线(悲观程度为0的dypm)时,使用悲观程度3的胜率从36.9%提升至77.8%,表明其在强对手面前依然有效。
  • 进一步提高悲观程度超过3虽减少失败,但增加了平局场次,表明收益递减,需谨慎进行超参数调优。
  • 性能对所选悲观程度高度敏感,证实通过自我对弈进行优化对获得最优结果至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。