[论文解读] Deep Reinforcement Learning with Stacked Hierarchical Attention for Text-based Games
本文提出 SHA-KG,一种用于文本游戏的深度强化学习智能体,通过将知识图谱(KGs)与堆叠的分层注意力机制相结合,实现显式、可解释的推理。通过基于知识图谱的子图建模关系与时间感知,并利用多层级注意力机制对文本观察和动作历史进行加权,该方法在基准游戏上实现了最先进性能,相较于现有智能体在样本效率和最终得分方面均有提升。
We study reinforcement learning (RL) for text-based games, which are interactive simulations in the context of natural language. While different methods have been developed to represent the environment information and language actions, existing RL agents are not empowered with any reasoning capabilities to deal with textual games. In this work, we aim to conduct explicit reasoning with knowledge graphs for decision making, so that the actions of an agent are generated and supported by an interpretable inference procedure. We propose a stacked hierarchical attention mechanism to construct an explicit representation of the reasoning process by exploiting the structure of the knowledge graph. We extensively evaluate our method on a number of man-made benchmark games, and the experimental results demonstrate that our method performs better than existing text-based agents.
研究动机与目标
- 解决现有用于文本游戏的强化学习智能体在推理能力方面的不足。
- 通过利用知识图谱(KGs)中的结构化知识,实现可解释的多步推理。
- 克服单一知识图谱表示无法捕捉关系与时间细微差别的局限性。
- 通过分层注意力机制,提升多模态输入(文本观察、知识图谱、动作历史)的融合效果。
- 开发一种方法,支持基于知识的显式推理与决策,增强泛化能力与性能。
提出的方法
- 基于语义角色(如物体位置、物品类型、动作历史)从知识图谱中构建动态子图,以编码关系与时间感知。
- 设计一种堆叠的分层注意力机制,分两个层次处理输入:(1) 对单个输入模态(如观察、库存、动作历史)进行局部注意力;(2) 在模态之间进行全局注意力。
- 使用多头注意力计算文本观察、知识图谱子图和历史动作的注意力权重,使模型能够聚焦于相关信息。
- 通过残差连接与层归一化聚合注意力输出,以稳定训练并提升表征学习效果。
- 使用深度强化学习(如 DQN 或 PPO)进行训练,奖励稀疏,策略网络基于分层注意力输出进行条件化。
- 从环境观察中提取新的知识三元组,并实时更新知识图谱,以保持世界状态表示的时效性。
实验结果
研究问题
- RQ1与标准强化学习智能体相比,利用知识图谱进行显式推理是否能提升文本游戏环境中的性能?
- RQ2在部分可观测、稀疏奖励的设置下,对多模态输入(文本、知识图谱、动作历史)进行分层注意力如何增强决策能力?
- RQ3知识图谱的子图(代表不同语义角色)在多大程度上提升了推理能力与可解释性?
- RQ4与简单拼接或对原始输入进行注意力相比,堆叠注意力机制在样本效率与最终得分方面是否表现更优?
- RQ5该模型能否在多样化、复杂化的文本游戏环境中保持可解释的推理路径并实现良好泛化?
主要发现
- 所提出的 SHA-KG 智能体在多个基准文本游戏上实现了最先进性能,优于现有基于学习的智能体。
- 模型表现出更高的样本效率,在较少训练步数内达到更高得分,优于基线智能体如 LSTM-DRQN 和 DRRN。
- 注意力分析显示,模型始终聚焦于相关信息(如物体位置、库存物品、近期动作),表明其具备有效的时间推理能力。
- 使用知识图谱的子图使智能体能够追踪关系与时间变化(如物体移动、物品获取),从而提升决策准确性。
- 堆叠的分层注意力机制有效平衡了多模态输入,注意力权重在观察、库存与动作历史模态之间呈现出有意义的分布。
- 智能体成功完成复杂任务,如组合物品(例如将'multi'放在'gores'上)和解决多步谜题,表明其具备稳健的推理能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。