Skip to main content
QUICK REVIEW

[论文解读] Playing Text-Adventure Games with Graph-Based Deep Reinforcement Learning

Prithviraj Ammanabrolu, Mark Riedl|arXiv (Cornell University)|Dec 4, 2018
Topic Modeling参考文献 16被引用 12
一句话总结

该论文提出KG-DQN,一种基于图的深度强化学习架构,利用知识图谱表示游戏状态并在文本冒险游戏中剪枝动作空间。通过将动作选择建模为问答任务并采用迁移学习进行预训练,该方法相比基线模型实现40%更快的最优奖励收敛速度,同时以更少的步骤保持高质量的任务解决方案。

ABSTRACT

Text-based adventure games provide a platform on which to explore reinforcement learning in the context of a combinatorial action space, such as natural language. We present a deep reinforcement learning architecture that represents the game state as a knowledge graph which is learned during exploration. This graph is used to prune the action space, enabling more efficient exploration. The question of which action to take can be reduced to a question-answering task, a form of transfer learning that pre-trains certain parts of our architecture. In experiments using the TextWorld framework, we show that our proposed technique can learn a control policy faster than baseline alternatives. We have also open-sourced our code at https://github.com/rajammanabrolu/KG-DQN.

研究动机与目标

  • 为解决文本冒险游戏中自然语言命令导致的动作空间组合爆炸问题。
  • 通过知识图谱实现持久的世界状态记忆,提升部分可观察环境中的样本效率。
  • 通过整合动作空间剪枝和基于问答预训练的迁移学习,加速学习收敛。
  • 证明显式、结构化的世界表示(知识图谱)在复杂、长时程的文本冒险游戏环境中优于非结构化嵌入。

提出的方法

  • 智能体维护一个动态知识图谱,用于捕获实体及其关系,随着智能体探索环境而动态演化。
  • 通过过滤掉涉及当前图状态中不存在的实体或关系的动作,利用知识图谱剪枝动作空间。
  • 图注意力网络(GAT)处理知识图谱,以在估计状态-动作对的Q值时关注相关子图。
  • 使用基于Transformer的编码器对自然语言动作进行嵌入,并通过状态描述与动作嵌入之间的可微交互机制计算Q值。
  • 利用外部游戏数据在问答任务上对模型进行预训练,将关于有效动作的通用知识迁移至初始策略,以提升策略质量。
  • 完整的KG-DQN架构在深度Q网络框架内整合了知识图谱状态表示、图注意力机制和预训练的动作编码器。

实验结果

研究问题

  • RQ1知识图谱表示是否能提升在动作空间庞大且组合复杂的文本冒险游戏中的样本效率和收敛速度?
  • RQ2基于知识图谱的动作剪枝是否能实现更快的学习速度并减少无效动作的探索?
  • RQ3通过问答范式对动作编码器进行预训练,在不同游戏之间知识迁移的程度如何,是否能加速策略学习?
  • RQ4与标准深度Q网络相比,持久记忆(知识图谱)与预训练的结合在学习速度和解决方案质量方面表现如何?

主要发现

  • 在小型TextWorld地图上,KG-DQN相比最佳基线模型(LSTM-DQN)实现最大可能奖励的收敛速度快40%。
  • 在大型地图上,KG-DQN达到与LSTM-DQN相当的性能,但所需episode数显著更少,收敛速度明显更快。
  • 去除剪枝或预训练的KG-DQN消融版本完成小型任务平均需131.7步,而完整模型仅需73.7步。
  • 完整KG-DQN模型在73.7 ± 8.5步内完成小型任务,与LSTM-DQN相比无统计学显著差异(p = 0.199),表明解决方案质量相当。
  • 通过问答方式进行的预训练提升了泛化能力,即使在未见过的游戏变体上也能实现更快收敛,无需显式指令。
  • 知识图谱提供了持久记忆,从而实现更快学习,这在所有KG-DQN变体中均表现出一致的性能提升,无论是否经过预训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。