Skip to main content
QUICK REVIEW

[论文解读] Learn How to Cook a New Recipe in a New House: Using Map Familiarization, Curriculum Learning, and Bandit Feedback to Learn Families of Text-Based Adventure Games

Xusen Yin, Jonathan May|arXiv (Cornell University)|Aug 13, 2019
Artificial Intelligence in Games被引用 5
一句话总结

本文提出了一种强化学习框架,通过结合地图熟悉化、课程学习和上下文Bandit探索,使智能体能够在特定主题(例如烹饪)下掌握未见过的文本类冒险游戏。通过在日益复杂的游戏实例上进行训练,并使用LinUCB进行不确定性感知探索,该智能体在新型、未见过的游戏上实现了显著更高的零样本性能,优于基线方法。

ABSTRACT

We consider the task of learning to play families of text-based computer adventure games, i.e., fully textual environments with a common theme (e.g. cooking) and goal (e.g. prepare a meal from a recipe) but with different specifics; new instances of such games are relatively straightforward for humans to master after a brief exposure to the genre but have been curiously difficult for computer agents to learn. We find that the deep Q-learning strategies that have been successfully leveraged for superhuman performance in single-instance action video games can be applied to learn families of text video games when adopting simple strategies that correlate with human-like learning behavior. Specifically, we build agents that learn to tackle simple scenarios before more complex ones using curriculum learning, that familiarize themselves in an unfamiliar environment by navigating before acting, and that explore uncertain environments more thoroughly using contextual multi-armed bandit decision policies. We demonstrate improved task completion rates over reasonable baselines when evaluating on never-before-seen games of that theme.

研究动机与目标

  • 使智能体能够泛化到共享主题(如烹饪)下的未见过的文本类冒险游戏,而非过度拟合于特定实例。
  • 通过模拟人类学习的渐进过程,采用课程学习提升零样本泛化能力。
  • 通过构建知识图谱,区分通用知识与实例特定知识,从而提升在陌生环境中的探索能力。
  • 在评估过程中引入上下文多臂老虎机反馈,以指导不确定状态下的探索,从而提升在未见过游戏中的表现。

提出的方法

  • 智能体使用课程学习,先在较简单的游戏实例(例如,第4级)上训练,再逐步过渡到更复杂的实例(例如,第6级),从而提升整体泛化能力。
  • 通过从环境描述中构建知识图谱实现地图熟悉化,使智能体能够区分通用知识(例如,'厨房用于烹饪')与实例特定的事实(例如,'厨房在卧室的东边')。
  • 在推理阶段,智能体应用LinUCB上下文Bandit策略,平衡探索与利用,优先选择不确定性高的动作,以提升得分。
  • DQN智能体使用基于CNN的状态表示来处理动作-观察轨迹,通过Q值预测选择动作。
  • 对比了多种探索策略:$͑$-greedy、带温度的策略采样和LinUCB;结果表明LinUCB表现更优。
  • 通过知识图谱构建来编码环境结构并指导动作规划,从而提升样本效率和泛化能力。

实验结果

研究问题

  • RQ1课程学习是否能在单实例训练之外,进一步提升文本类冒险游戏中零样本泛化能力?
  • RQ2通过知识图谱构建实现的地图熟悉化,在未见过的环境中如何提升学习效果?
  • RQ3在评估过程中引入上下文Bandit反馈,是否能提升在新型、未见过游戏中的表现?
  • RQ4不同探索策略——$͑$-greedy、策略采样和LinUCB——在零样本设置下的任务完成中,其相对影响如何?

主要发现

  • LinUCB Bandit策略表现最佳,在Test 1上达到72%的平均成功率,在Test 2上达到68%,优于$͑$-greedy和采样方法。
  • 采用分层训练的课程学习(例如,从第4级开始)相比同时训练所有层级,整体性能更优,最佳结果出现在对所有层级进行微调之后。
  • 知识图谱构建通过使智能体能够区分通用知识与实例特定知识,显著提升了学习效果,支持更好的泛化能力。
  • 通过LinUCB进行探索显著优于$͑$-greedy和策略采样,尤其是在复杂层级中,因其对不确定动作进行了更全面且有依据的探索。
  • 观察到课程学习中的近期效应:当某一层级作为最后训练层级时,其性能最高,表明后期训练阶段具有更强的影响。
  • 在课程训练后使用LinUCB探索,智能体在完整测试集上实现了68%的平均成功率,证明了其强大的零样本泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。