Skip to main content
QUICK REVIEW

[论文解读] Towards Solving Text-based Games by Producing Adaptive Action Spaces

Ruo Yu Tao, Marc-Alexandre Côté|arXiv (Cornell University)|Dec 3, 2018
Topic Modeling参考文献 15被引用 5
一句话总结

本文提出了一种神经序列到集合的生成模型,用于在文本游戏环境中生成自适应、上下文感知的动作空间,采用三种编码器-解码器架构——带束搜索的指针-Softmax(PS + BS)、带指针-Softmax的层次RNN(HRED + PS)以及拼接命令生成(PS + Cat)。表现最佳的模型(PS + Cat)在ACG数据集上达到96.5的F1分数,在ACGE数据集上达到97.6,能够以高准确率泛化到未见过的有效命令上。

ABSTRACT

To solve a text-based game, an agent needs to formulate valid text commands for a given context and find the ones that lead to success. Recent attempts at solving text-based games with deep reinforcement learning have focused on the latter, i.e., learning to act optimally when valid actions are known in advance. In this work, we propose to tackle the first task and train a model that generates the set of all valid commands for a given context. We try three generative models on a dataset generated with Textworld. The best model can generate valid commands which were unseen at training and achieve high $F_1$ score on the test set.

研究动机与目标

  • 为解决在文本游戏中生成有效、上下文相关的文本命令这一挑战,该挑战在强化学习方法中常被忽视。
  • 训练一个监督模型,将游戏上下文和玩家背包映射为可接受动作的集合,而非从固定动作集中进行选择。
  • 通过生成未见过的有效命令来提升泛化能力,使智能体能够更有效地探索和解决游戏。
  • 评估并比较三种神经序列到集合生成架构在生成多样化、准确且上下文相关命令集方面的能力。
  • 为将自适应命令生成与强化学习策略集成,实现端到端求解文本游戏奠定基础。

提出的方法

  • 模型在由TextWorld生成的(上下文,动作集合)对的监督数据集上进行训练,其中动作被定义为改变状态的命令。
  • 评估了三种架构:(1) 带束搜索的指针-Softmax(PS + BS),(2) 带指针-Softmax的层次RNN(HRED + PS),以及(3) 带拼接命令的指针-Softmax(PS + Cat)。
  • PS + Cat模型使用分隔符标记来划分单个输出序列中的多个命令,从而实现在输入上下文上的注意力联合解码。
  • HRED + PS模型采用层次解码策略,其中会话级别的隐藏状态用于条件生成集合中的每个命令。
  • PS + BS模型通过束搜索生成固定数量的命令,这限制了灵活性,并在目标数量与束大小不一致时导致过度生成。
  • 所有模型均通过最大化真实命令集合的对数似然进行训练,损失函数根据每种架构的结构进行定制。

实验结果

研究问题

  • RQ1神经序列到集合模型能否有效生成与给定游戏上下文相关的多样化、有效文本命令?
  • RQ2不同序列到集合生成架构在F1分数、对已见与未见命令的召回率以及对未见动作的泛化能力方面如何比较?
  • RQ3与固定束搜索相比,使用层次解码或拼接命令生成是否能提升命令集合生成的性能?
  • RQ4该模型在复杂或受限的游戏环境中对训练期间未见的命令能实现多大程度的泛化?
  • RQ5使用预训练嵌入(如GloVe)在多大程度上影响模型在命令生成任务上的性能?

主要发现

  • PS + Cat模型在ACG数据集上达到最高的F1分数96.5,在ACGE数据集上达到97.6,优于HRED + PS和PS + BS模型。
  • PS + Cat模型在ACG上的未见命令召回率达到83.0%,在ACGE上达到76.7%,表现出对训练期间未见命令的强大泛化能力。
  • HRED + PS模型的表现优于PS + BS,但逊于PS + Cat,可能是因为门控机制在缺乏多轮查询时阻碍了梯度流动。
  • 使用固定束大小的束搜索(PS + BS)存在过度生成问题,且与实际目标命令数量对齐不佳,尽管精确率较高,但F1分数仍较低。
  • 移除预训练的GloVe嵌入仅导致F1分数轻微下降(≤0.2%),表明模型性能对嵌入初始化不匹配具有鲁棒性。
  • 模型能够生成大量有效且未见过的命令,当束大小与预期动作数匹配时,束搜索有助于提升多样性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。