Skip to main content
QUICK REVIEW

[论文解读] Learn How to Cook a New Recipe in a New House: Using Map Familiarization, Curriculum Learning, and Common Sense to Learn Families of Text-Based Adventure Games

Xusen Yin, Jonathan May|arXiv (Cornell University)|Aug 13, 2019
Artificial Intelligence in Games参考文献 21被引用 12
一句话总结

本文提出一种结合地图熟悉化与上下文多臂老虎机的课程学习方法,使AI智能体能够学习具有共享主题(如烹饪)但具体细节各异的文本类冒险游戏家族。通过模拟人类学习方式——从简单开始、先探索环境、再优先处理不确定动作——该智能体在相同主题家族中未见过的游戏上实现了显著更高的成功率,优于基线方法。

ABSTRACT

We consider the task of learning to play families of text-based computer adventure games, i.e., fully textual environments with a common theme (e.g. cooking) and goal (e.g. prepare a meal from a recipe) but with different specifics; new instances of such games are relatively straightforward for humans to master after a brief exposure to the genre but have been curiously difficult for computer agents to learn. We find that the deep Q-learning strategies that have been successfully leveraged for superhuman performance in single-instance action video games can be applied to learn families of text video games when adopting simple strategies that correlate with human-like learning behavior. Specifically, we build agents that learn to tackle simple scenarios before more complex ones using curriculum learning, that familiarize themselves in an unfamiliar environment by navigating before acting, and that explore uncertain environments more thoroughly using contextual multi-armed bandit decision policies. We demonstrate improved task completion rates over reasonable baselines when evaluating on never-before-seen games of that theme.

研究动机与目标

  • 解决在具有共享主题但具体细节各异的文本类冒险游戏家族中实现泛化的问题。
  • 提升强化学习智能体在文本类游戏中的样本效率与泛化能力,超越单一实例的性能表现。
  • 模拟人类学习行为,如逐步掌握技能与在行动前先探索环境。
  • 通过引入常识与上下文探索策略,减少对大量预训练的依赖。

提出的方法

  • 智能体使用课程学习,从同一主题家族中的简单游戏实例逐步过渡到更复杂的实例。
  • 在采取行动前,智能体通过在环境中导航,执行地图熟悉化阶段,以建立空间意识与物体认知。
  • 上下文多臂老虎机策略通过优先选择不确定性高的动作来引导探索,提升样本效率。
  • 智能体利用常识与环境结构推断合理动作,从而缩小动作空间。
  • 该方法将深度Q学习与分层探索和规划相结合,以提升长时序任务的完成能力。
  • 该框架在相同主题(如烹饪)的游戏课程上进行训练,并在同一家族中未见过的游戏上进行评估。

实验结果

研究问题

  • RQ1课程学习能否提升在主题家族内文本类冒险游戏中的零样本泛化能力?
  • RQ2在采取行动前进行地图熟悉化,如何影响样本效率与成功率?
  • RQ3上下文多臂老虎机在部分可观察的文本类环境中,能在多大程度上提升探索效率?
  • RQ4常识推理在多大程度上可减少对单个游戏实例大量训练的需求?
  • RQ5将这些策略结合后,是否能在未见游戏中实现相对于标准深度Q学习基线的可测量性能提升?

主要发现

  • 所提方法在相同主题家族中未见过的游戏上,实现了显著更高的任务完成率,优于强基线智能体。
  • 在行动前进行地图熟悉化,可加快收敛速度,并在新环境中实现更可靠的导航。
  • 上下文多臂老虎机通过聚焦于不确定或高信息量的动作,提升了探索效率。
  • 课程学习策略使智能体能够泛化到具有不同复杂度与物体配置的游戏实例。
  • 智能体展现出类似人类的学习进展过程,从简单任务开始,逐步掌握复杂任务。
  • 该框架能有效泛化到同主题的新游戏,表明其在实例间具备稳健的迁移学习能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。