Skip to main content
QUICK REVIEW

[论文解读] Enhancing Text-based Reinforcement Learning Agents with Commonsense Knowledge

Keerthiram Murugesan, Mattia Atzeni|arXiv (Cornell University)|May 2, 2020
Topic Modeling参考文献 33被引用 17
一句话总结

本文提出了一种用于文本环境的强化学习智能体,通过将符号化信念图与ConceptNet中的常识知识相结合,以减少探索并提高样本效率。通过动态融合实时环境观测与外部知识,该智能体在厨房清理和烹饪食谱任务中表现出优越性能,但过多的知识可能阻碍学习,凸显了上下文感知知识整合的必要性。

ABSTRACT

In this paper, we consider the recent trend of evaluating progress on reinforcement learning technology by using text-based environments and games as evaluation environments. This reliance on text brings advances in natural language processing into the ambit of these agents, with a recurring thread being the use of external knowledge to mimic and better human-level performance. We present one such instantiation of agents that use commonsense knowledge from ConceptNet to show promising performance on two text-based environments.

研究动机与目标

  • 通过整合常识知识,解决文本强化学习智能体的样本低效问题。
  • 研究来自ConceptNet的外部知识如何在TextWorld等文本环境中减少探索。
  • 探索常识知识在何种条件下能提升或损害智能体性能。
  • 开发一种双图架构,以符号化方式表示智能体的当前信念状态和全局常识知识。
  • 在多样化的文本任务上评估该方法,包括厨房清理和基于食谱的游戏。

提出的方法

  • 智能体维护一个局部信念图,基于文本观测符号化地表示其对环境的当前感知。
  • 利用ConceptNet中的实体和关系构建一个全局常识图,以表示外部世界知识。
  • 通过可微注意力机制将信念图与常识图融合,以指导动作选择。
  • 系统支持两种知识集成模式:全图模式(从开始即可访问全部知识)和演化图模式(随着智能体探索逐步添加知识)。
  • 该方法采用受Graph-Aided Transformer Agent(GATA)启发的框架,通过符号图上的自注意力机制学习状态表示。
  • 性能在两个文本任务(厨房清理和基于食谱的烹饪游戏)上通过多次运行进行评估。

实验结果

研究问题

  • RQ1在文本强化学习环境中,整合来自ConceptNet的常识知识是否能减少探索并提高样本效率?
  • RQ2知识集成的时间(全图 vs. 渐进式)如何影响智能体性能?
  • RQ3在何种条件下,外部知识会降低而非提升智能体性能?
  • RQ4符号化信念图与常识知识的融合如何增强文本游戏中的决策能力?
  • RQ5在何种场景下,真实信念图信息比常识知识更具优势?

主要发现

  • 所提出的智能体在厨房清理任务中优于简单文本智能体和GATA基线模型,表现出更少的探索和更快的收敛速度。
  • 在烹饪食谱任务中,演化图设置(渐进式知识)优于全图设置,表明延迟知识集成可减少噪声并提升性能。
  • GATA_Full智能体在烹饪食谱任务中表现最佳,表明在目标局部化且简单的任务中,真实状态信息比常识知识更有效。
  • 过多或未经充分过滤的常识知识可能使智能体不堪重负,导致性能下降,尤其在低复杂度环境中更为明显。
  • 双图方法(信念图 + 常识知识)在复杂任务(如厨房清理)中显著提升了性能,因为此类任务需要对物体位置和关系进行推理。
  • 结果表明,知识集成必须具备上下文感知能力:常识知识的效用取决于任务复杂度和环境结构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。