Skip to main content
QUICK REVIEW

[论文解读] Experience-Driven PCG via Reinforcement Learning: A Super Mario Bros Study

Tianye Shu, Jialin Liu|ArXiv.org|Jun 30, 2021
Artificial Intelligence in Games被引用 7
一句话总结

本文提出EDRL框架,结合经验驱动的程序化内容生成(EDPCG)与强化学习(PCGRL),实现实时生成无限、可玩且有趣的《超级马里奥兄弟》关卡。通过使用预训练生成对抗网络(GAN)生成的潜在向量来构建关卡片段,强化学习(RL)智能体选择并拼接这些片段,同时通过基于KL散度的奖励函数优化趣味性与多样性,自动修复与基于AI的可玩性测试确保了生成关卡的质量与正确性。

ABSTRACT

We introduce a procedural content generation (PCG) framework at the intersections of experience-driven PCG and PCG via reinforcement learning, named ED(PCG)RL, EDRL in short. EDRL is able to teach RL designers to generate endless playable levels in an online manner while respecting particular experiences for the player as designed in the form of reward functions. The framework is tested initially in the Super Mario Bros game. In particular, the RL designers of Super Mario Bros generate and concatenate level segments while considering the diversity among the segments. The correctness of the generation is ensured by a neural net-assisted evolutionary level repairer and the playability of the whole level is determined through AI-based testing. Our agents in this EDRL implementation learn to maximise a quantification of Koster's principle of fun by moderating the degree of diversity across level segments. Moreover, we test their ability to design fun levels that are diverse over time and playable. Our proposed framework is capable of generating endless, playable Super Mario Bros levels with varying degrees of fun, deviation from earlier segments, and playability. EDRL can be generalised to any game that is built as a segment-based sequential process and features a built-in compressed representation of its game content.

研究动机与目标

  • 开发一种基于强化学习的在线、经验驱动的程序化内容生成(PCG)框架。
  • 解决在复杂平台游戏(如《超级马里奥兄弟》)中实时生成无限、可玩且多样化的关卡的挑战。
  • 将玩家体验度量指标——特别是趣味性与历史偏离度——形式化并整合到强化学习奖励函数中,以实现个性化关卡设计。
  • 通过神经网络辅助的进化修复与基于AI的可玩性测试,确保生成关卡的可玩性与正确性。
  • 证明EDRL框架在GVGAI基准游戏之外的可行性与可扩展性,特别是在动作空间较大且采用分段式关卡设计的游戏中的应用潜力。

提出的方法

  • EDRL框架利用预训练的生成对抗网络(GAN)生成关卡片段,以潜在向量形式表示,实现高效的在线处理。
  • 强化学习(RL)智能体选择并拼接这些潜在向量,实时构建更长的关卡,其行为受兼顾趣味性与多样性的奖励函数引导。
  • 奖励函数通过调节连续关卡片段之间的Kullback-Leibler(KL)散度来量化Koster的趣味性原则,以维持适度的差异性。
  • 通过CNet辅助的进化算法修复生成关卡中的结构性缺陷(如断裂的管道),以确保正确性。
  • 使用A*智能体验证可玩性,测试关卡是否可被完整通关。
  • 系统支持在线运行,实现动态、实时的关卡生成,能够根据玩家体验度量指标自适应调整。

实验结果

研究问题

  • RQ1强化学习能否有效用于在《超级马里奥兄弟》这类复杂平台游戏中生成无限、可玩且有趣的关卡,而不仅限于GVGAI框架?
  • RQ2如何将趣味性与历史偏离度等玩家体验度量指标形式化,并整合到基于强化学习的关卡生成系统中?
  • RQ3基于预训练GAN的潜在向量生成在多大程度上能够实现实时、可扩展且多样的关卡组合?
  • RQ4如何通过自动化修复与基于AI的可玩性测试,在无需人工干预的情况下确保生成关卡的正确性与可玩性?
  • RQ5EDRL框架能否推广至其他以序列化、分段式流程构建、且具有压缩内容表示的游戏?

主要发现

  • EDRL框架成功实现实时生成无限、可玩的《超级马里奥兄弟》关卡,强化学习智能体通过基于KL散度的奖励函数设计,有效平衡了趣味性与多样性。
  • 强化学习智能体在关卡片段间实现了适中的KL散度水平,表明其有效调控了多样性,避免了过度不可预测性,从而维持了玩家参与度。
  • 神经网络辅助的进化修复机制能有效修复生成关卡中的结构性缺陷,显著提升了正确性并降低了失败率。
  • 基于AI的A*测试确认所有生成关卡均可完整通关,确保最终输出具备功能性与完整性。
  • 该框架在GVGAI游戏之外展现出良好的可扩展性,表明其在动作空间更大、采用分段式设计的复杂游戏中具有应用潜力。
  • 该方法通过适配测试智能体的行为,实现了个性化关卡生成,暗示其具备根据玩家技能与偏好进行动态调整的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。