Skip to main content
QUICK REVIEW

[论文解读] Keep CALM and Explore: Language Models for Action Generation in Text-based Games

Shunyu Yao, Rohan Rao|arXiv (Cornell University)|Oct 6, 2020
Topic Modeling参考文献 24被引用 8
一句话总结

本文提出了上下文动作语言模型(CALM),一种基于人类游戏转录文本训练的语言模型,用于在文本游戏环境中生成紧凑且语义相关的动作候选集。通过将CALM与强化学习智能体(DRRN)结合,该方法在Jericho基准测试中相较先前最先进模型实现了69%的平均得分相对提升,甚至在多个游戏中超越了那些可访问真实可行动作的模型。

ABSTRACT

Text-based games present a unique challenge for autonomous agents to operate in natural language and handle enormous action spaces. In this paper, we propose the Contextual Action Language Model (CALM) to generate a compact set of action candidates at each game state. Our key insight is to train language models on human gameplay, where people demonstrate linguistic priors and a general game sense for promising actions conditioned on game history. We combine CALM with a reinforcement learning agent which re-ranks the generated action candidates to maximize in-game rewards. We evaluate our approach using the Jericho benchmark, on games unseen by CALM during training. Our method obtains a 69% relative improvement in average game score over the previous state-of-the-art model. Surprisingly, on half of these games, CALM is competitive with or better than other models that have access to ground truth admissible actions. Code and data are available at https://github.com/princeton-nlp/calm-textgame.

研究动机与目标

  • 解决文本游戏中动作空间组合爆炸的问题,其中仅有一小部分动作是可接受的。
  • 在不依赖手工规则或真实动作集合的前提下,将语言先验和人类游戏直觉融入动作生成。
  • 通过使用上下文感知语言模型过滤动作空间,提升强化学习智能体的样本效率和性能。
  • 展示单一CALM模型在多样化、未见过的文本游戏中具备泛化能力。

提出的方法

  • 在590款不同文本游戏的426份人类游戏转录文本上训练语言模型(n-gram或GPT-2),以学习上下文相关的动作生成。
  • 使用训练好的CALM在每个游戏状态生成一个前K名的动作候选列表,条件为当前观察结果和游戏历史。
  • 将CALM与深度强化相关性网络(DRRN)集成,后者根据预测的Q值和游戏内奖励对生成的动作进行重排序。
  • 使用游戏奖励端到端训练DRRN,同时在人类数据上预训练后保持CALM固定。
  • 在不进行微调的情况下,使用单一CALM实例部署于多款游戏,确保对评估游戏实现零样本泛化。
  • 通过孤立生成(与真实可行动作对比)和在Jericho基准测试上的端到端强化学习性能,评估动作质量。

实验结果

研究问题

  • RQ1在多样化的文本游戏中,基于人类游戏转录文本训练的语言模型能否生成语义相关且可接受的动作候选?
  • RQ2将上下文语言模型与强化学习智能体结合,是否能在不访问真实动作集合的情况下,相比先前方法提升性能?
  • RQ3单一CALM模型在未见过的文本游戏中,无需微调,其泛化能力能达到何种程度?
  • RQ4在某些场景下,CALM生成的动作候选是否能超越那些可访问真实可行动作的模型?

主要发现

  • CALM + DRRN方法在Jericho基准测试中相较先前最先进模型实现了69%的平均归一化得分相对提升。
  • 在28款评估游戏中的8款,CALM的表现优于可访问真实可行动作的模型,包括在游戏'inhumane'中取得25.7分,而先前最先进模型仅得3分。
  • 与n-gram基线相比,GPT-2版本的CALM在涉及物体交互和常识动作的定性示例中,生成了更具语义连贯性和上下文相关性的动作。
  • 在孤立生成场景下,CALM(GPT-2)生成的动作候选与真实可行动作高度一致,表明其具备强大的语言和游戏直觉先验。
  • 该方法在多样化游戏环境中表现出有效的泛化能力,单一CALM模型在所有28款评估游戏中均未进行任何游戏特定调整即成功部署。
  • 该方法表明,人类游戏数据可有效将语言和策略先验提炼为紧凑、可重用的动作生成机制,适用于文本游戏智能体。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。