Skip to main content
QUICK REVIEW

[论文解读] Taking the Scenic Route: Automatic Exploration for Videogames

Zeping Zhan, Batu Aytemiz|arXiv (Cornell University)|Dec 7, 2018
Artificial Intelligence in Games参考文献 18被引用 6
一句话总结

本文提出了一种用于电子游戏的自动探索策略,旨在在人类游戏测试的时间尺度内,最大化对多样化游戏状态的覆盖,使用与游戏无关和与游戏相关的度量标准来评估探索质量。结果表明,诸如RRT和混沌猴子等基础AI方法可达到甚至超越人类探索效率,从而实现游戏内容的语义映射,适用于游戏分析、测试和搜索等应用。

ABSTRACT

Machine playtesting tools and game moment search engines require exposure to the diversity of a game's state space if they are to report on or index the most interesting moments of possible play. Meanwhile, mobile app distribution services would like to quickly determine if a freshly-uploaded game is fit to be published. Having access to a semantic map of reachable states in the game would enable efficient inference in these applications. However, human gameplay data is expensive to acquire relative to the coverage of a game that it provides. We show that off-the-shelf automatic exploration strategies can explore with an effectiveness comparable to human gameplay on the same timescale. We contribute generic methods for quantifying exploration quality as a function of time and demonstrate our metric on several elementary techniques and human players on a collection of commercial games sampled from multiple game platforms (from Atari 2600 to Nintendo 64). Emphasizing the diversity of states reached and the semantic map extracted, this work makes productive contrast with the focus on finding a behavior policy or optimizing game score used in most automatic game playing research.

研究动机与目标

  • 开发高效的自动探索策略,使电子游戏的语义状态空间覆盖在与人类游戏测试相当的时间尺度内完成。
  • 使用既与游戏无关又与游戏相关的度量标准量化探索质量,实现跨平台和跨游戏的比较。
  • 评估自动探索策略在游戏状态多样性与覆盖范围方面与人类探索的匹配程度或超越程度。
  • 通过生成具有代表性的状态空间地图,支持下游应用,如游戏时刻索引、语义相似性推断和自动化应用测试。
  • 探索从自对弈中自举感知模型的可行性,并在不同策略间复用探索数据。

提出的方法

  • 作者定义了四种探索质量度量标准:Inception核范数(一种基于视觉嵌入的与游戏无关的度量标准),以及三种与游戏相关的度量标准,包括状态访问多样性与场景覆盖度。
  • 在从Atari 2600到Nintendo 64的多种商业游戏中应用基础探索策略——混沌猴子(随机动作)、RRT(快速扩展随机树)以及混合策略。
  • 使用自对弈训练循环,通过在探索过程中收集的轨迹重新训练Inception网络,以自举生成与游戏相关的感知模型。
  • 以游戏时长为函数衡量探索进展,随时间跟踪度量标准,以比较不同策略与人类玩家的效率。
  • 混合策略将混沌猴子的初始随机探索与RRT的结构化扩展相结合,利用混沌猴子的结果作为RRT树的种子。
  • 所有实验均使用BizHawk模拟器进行,游戏过程通过截图、操作记录和内存快照进行记录,用于度量标准的计算。

实验结果

研究问题

  • RQ1在相同的时间预算内,自动探索策略能否实现与人类游戏测试者相当或更好的游戏状态空间覆盖?
  • RQ2不同探索策略(如混沌猴子、RRT)在多样化游戏和平台上的语义状态多样性方面表现如何?
  • RQ3通过使用自动探索收集的数据进行自对弈训练,感知模型能在多大程度上得到改进?
  • RQ4是否可以使用单一的、与平台无关的度量标准(如Inception核范数)公平地比较视觉和机制复杂度截然不同的游戏之间的探索进展?
  • RQ5结合随机探索与结构化探索(如混沌猴子 + RRT)是否能带来比单一策略更优的整体覆盖效果?

主要发现

  • 如RRT和混沌猴子等基础自动探索策略在10至30分钟的游戏时间内,可实现与人类游戏测试者相当的探索质量。
  • Inception核范数度量标准成功捕捉了探索进展,并实现了探索质量在跨游戏和跨平台间的比较。
  • 利用混沌猴子为RRT树提供种子的混合策略优于单一策略,表明结合随机与结构化探索可提升覆盖范围。
  • 在自动收集的轨迹上进行自对弈训练,显著提升了感知模型的质量,从而在后续运行中实现更快、更深入的探索。
  • 部分游戏(如Super Mario World)表明,自动探索在短时间内即可在状态多样性方面超越人类表现。
  • 探索效果在不同游戏和平台间存在显著差异,性能取决于视觉多样性以及初始感知模型的质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。