Skip to main content
QUICK REVIEW

[论文解读] CCPT: Automatic Gameplay Testing and Validation with Curiosity-Conditioned Proximal Trajectories

Alessandro Sestini, Linus Gisslén|arXiv (Cornell University)|Feb 21, 2022
Artificial Intelligence in Games被引用 5
一句话总结

本文提出CCPT,一种结合好奇心驱动探索与模仿学习的深度强化学习方法,用于在复杂的3D导航环境中自动检测游戏玩法错误和设计疏漏。通过训练智能体在专家示范附近探索,并利用探索条件化的内在奖励,CCPT实现了更优的覆盖范围,能够识别可疑或异常的轨迹,使游戏设计师得以在极少人工干预的情况下自动标记并分析问题。

ABSTRACT

This paper proposes a novel deep reinforcement learning algorithm to perform automatic analysis and detection of gameplay issues in complex 3D navigation environments. The Curiosity-Conditioned Proximal Trajectories (CCPT) method combines curiosity and imitation learning to train agents to methodically explore in the proximity of known trajectories derived from expert demonstrations. We show how CCPT can explore complex environments, discover gameplay issues and design oversights in the process, and recognize and highlight them directly to game designers. We further demonstrate the effectiveness of the algorithm in a novel 3D navigation environment which reflects the complexity of modern AAA video games. Our results show a higher level of coverage and bug discovery than baselines methods, and it hence can provide a valuable tool for game designers to identify issues in game design automatically.

研究动机与目标

  • 为解决复杂AAA级游戏中人工测试耗时且常因规模与复杂性而无法全面覆盖的挑战。
  • 开发一种自动化方法,系统性地探索游戏环境,并检测诸如缺失碰撞盒或游戏异常等玩法问题。
  • 使游戏设计师能够无需完全依赖人工测试或随机探索,即可识别并标记有问题的轨迹。
  • 结合内在好奇心与专家示范,引导智能体在已知优质路径附近进行有意义且有针对性的探索。
  • 构建一个可扩展、可复用的自动化玩法测试框架,相较于基线探索与模仿方法具有显著改进。

提出的方法

  • CCPT采用混合强化学习框架,将模仿学习与基于好奇心的内在奖励相结合,以引导智能体行为。
  • 该方法使用探索条件化的内在奖励函数,激励智能体在保持靠近专家示范的同时探索新状态。
  • 使用3D语义占据图编码环境结构,并结合位置嵌入表示智能体的全局位置。
  • 策略网络通过3D卷积架构处理观测输入,基于语义与空间信息做出决策。
  • 评估阶段,训练中使用的相同好奇心模块用于过滤并突出显示与预期行为显著偏离的轨迹,指示潜在错误。
  • 该方法不仅利用专家示范引导导航,还用于定义目标测试区域。

实验结果

研究问题

  • RQ1强化学习智能体能否在保持靠近专家轨迹的同时,有效探索复杂的3D游戏环境,以检测设计疏漏?
  • RQ2结合好奇心与模仿学习相较于仅使用好奇心或仅使用模仿学习,在探索覆盖范围与错误检测方面有何改进?
  • RQ3位置嵌入与语义占据图在多大程度上提升了智能体在导航中泛化与异常检测的能力?
  • RQ4内在好奇心模块能否自动过滤并突出显示可疑或异常的游戏轨迹?
  • RQ5当迭代应用于发现先前未测试区域的新问题时,CCPT框架的可扩展性如何?

主要发现

  • CCPT在地图覆盖方面优于纯模仿与纯好奇心驱动的探索方法,发现了更多样化且更广泛的路径。
  • 使用CCPT训练的智能体在保持高度覆盖的同时仍能遵循专家示范,从而实现对偏差的精确定位。
  • 消融实验表明,位置嵌入显著优于归一化值或学习得到的嵌入,性能表现更优。
  • 3D语义占据图与3D卷积网络的结合优于基于射线投射的基线方法及仅使用全局表示的方法。
  • 好奇心模块成功识别并突出显示了存在潜在玩法问题的轨迹,如缺失碰撞盒或非预期行为。
  • 通过将先前识别出的问题轨迹作为新示范,迭代应用CCPT可缓解模式崩溃问题,并将覆盖范围扩展至此前未探索的问题区域。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。