Skip to main content
QUICK REVIEW

[论文解读] Fully Differentiable Procedural Content Generation through Generative Playing Networks

Philip Bontrager, Julian Togelius|arXiv (Cornell University)|Feb 12, 2020
Artificial Intelligence in Games参考文献 23被引用 15
一句话总结

本文提出了生成式对弈网络(GPN),一种完全可微分的框架,通过共生强化学习过程联合训练智能体与程序化内容生成器。生成器根据评论家的反馈生成关卡,隐式形成一种课程,根据智能体能力动态调整挑战难度,实现无需人工设计示例或领域知识的端到端训练,已在2D地牢探索游戏中得到验证。

ABSTRACT

To procedurally create interactive content such as environments or game levels, we need agents that can evaluate the content; but to train such agents, we need content they can train on. Generative Playing Networks is a framework that learns agent policies and generates environments in tandem through a symbiotic process. Policies are learned using an actor-critic reinforcement learning algorithm so as to master the environment, and environments are created by a generator network which tries to provide an appropriate level of challenge for the agent. This is accomplished by the generator learning to make content based on estimates by the critic. Thus, this process provides an implicit curriculum for the agent, creating more complex environments over time. Unlike previous approaches to procedural content generation, Generative Playing Networks is end-to-end differentiable and does not require human-designed examples or domain knowledge. We demonstrate the capability of this framework by training an agent and level generator for a 2D dungeon crawler game.

研究动机与目标

  • 为解决程序化内容生成中的鸡生蛋问题,即智能体需要内容来训练,而内容又需要智能体来评估。
  • 消除在训练程序化内容生成器时对人工设计内容或特定领域启发式规则的依赖。
  • 开发一种统一的、可微分的框架,通过强化学习同时训练智能体策略与内容生成器。
  • 使生成器能够通过根据智能体表现估计动态调整关卡难度,隐式构建课程。

提出的方法

  • 该框架采用演员-评论家强化学习设置,其中智能体(演员)学习导航关卡,评论家评估其表现。
  • 生成器网络基于评论家的价值估计生成关卡,利用其作为信号来调控内容复杂度。
  • 训练过程完全可微分,允许梯度从评论家的评估反向传播至生成器和智能体。
  • 生成器学习生成在当前智能体策略表现下具有挑战性但可解的关卡。
  • 该过程形成一个反馈回路:表现更优的智能体导致更复杂的关卡,而更优的关卡又进一步提升智能体策略。
  • 未使用人工设计的示例或手工规则——训练完全通过智能体-环境交互循环实现自监督。

实验结果

研究问题

  • RQ1能否在无需人工设计示例的情况下,通过完全可微分的框架联合训练智能体与程序化内容生成器?
  • RQ2生成器如何学习生成基于智能体表现的隐式课程内容?
  • RQ3评论家反馈在多大程度上能引导生成器创建逐步提升难度但可解的关卡?
  • RQ4端到端可微分性是否能实现智能体与内容生成器的稳定且有效的训练?
  • RQ5这种共生训练过程与传统的监督式或启发式程序化内容生成方法相比有何差异?

主要发现

  • 该框架成功实现了在无需人工设计内容的情况下,对智能体策略与关卡生成器的完全可微分、端到端联合训练。
  • 生成器学习到根据智能体当前表现动态调整关卡难度,从而隐式形成课程。
  • 评论家的价值估计有效引导生成器创建与智能体不断演进的技能水平相匹配的内容。
  • 该方法通过基于梯度的优化实现稳定训练,避免了对手工规则或奖励塑形的依赖。
  • 该方法在2D地牢探索环境中展示了可行性,表明智能体能够学会掌握日益复杂的关卡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。