Skip to main content
QUICK REVIEW

[论文解读] Text-based RL Agents with Commonsense Knowledge: New Challenges, Environments and Baselines

Keerthiram Murugesan, Mattia Atzeni|arXiv (Cornell University)|Oct 8, 2020
Topic Modeling被引用 7
一句话总结

本文提出一种结合外部知识源(如ConceptNet)的文本强化学习智能体,利用知识嵌入(Numberbatch与Complex)提升Text World环境中决策能力。核心贡献在于证明:与基线智能体相比,知识增强型智能体在奖励和样本效率方面均有显著提升,其中知识型智能体在测试阶段最高可实现8.26的平均奖励。

ABSTRACT

Text-based games have emerged as an important test-bed for Reinforcement Learning (RL) research, requiring RL agents to combine grounded language understanding with sequential decision making. In this paper, we examine the problem of infusing RL agents with commonsense knowledge. Such knowledge would allow agents to efficiently act in the world by pruning out implausible actions, and to perform look-ahead planning to determine how current actions might affect future world states. We design a new text-based gaming environment called TextWorld Commonsense (TWC) for training and evaluating RL agents with a specific kind of commonsense knowledge about objects, their attributes, and affordances. We also introduce several baseline RL agents which track the sequential context and dynamically retrieve the relevant commonsense knowledge from ConceptNet. We show that agents which incorporate commonsense knowledge in TWC perform better, while acting more efficiently. We conduct user-studies to estimate human performance on TWC and show that there is ample room for future improvement.

研究动机与目标

  • 为解决文本强化学习智能体在复杂、开放环境中的局限性,通过引入外部常识知识。
  • 探究来自开放知识源(如ConceptNet)的知识嵌入如何提升智能体在部分可观测、序列决策任务中的性能。
  • 在受控实验环境中设计并评估多种智能体变体——简单型、历史增强型与知识增强型。
  • 为评估文本环境中知识增强型强化学习,建立新的基线与环境。

提出的方法

  • 环境被建模为部分可观测马尔可夫决策过程(POMDP),使用Text World框架构建文本交互式环境。
  • 实现三种智能体变体:使用词嵌入的简单智能体、整合历史动作-奖励上下文的改进型智能体,以及融合知识图谱嵌入的知识增强型智能体。
  • 知识嵌入通过ConceptNet使用Numberbatch与Complex嵌入模型生成,并与历史和状态表征融合。
  • 智能体的动作选择基于包含GRU与注意力机制的神经网络,联合处理状态、历史与知识嵌入。
  • 通过200次运行进行训练与评估,以确保统计稳健性,主要度量指标为奖励与步数。
  • 知识增强型智能体采用混合表征,结合历史上下文与外部知识嵌入,以降低动作空间复杂度。

实验结果

研究问题

  • RQ1来自开放知识源(如ConceptNet)的外部常识知识是否能提升文本强化学习智能体在复杂环境中的性能?
  • RQ2与基线智能体相比,知识嵌入的整合如何影响样本效率与最终性能?
  • RQ3不同知识嵌入类型(如Numberbatch与Complex)对智能体学习动态的相对影响为何?
  • RQ4仅使用历史上下文是否能带来性能提升,还是外部知识对显著增益至关重要?
  • RQ5知识增强型智能体在未见环境或任务中的泛化能力如何?

主要发现

  • 使用Complex嵌入的知识型智能体在测试阶段获得最高平均奖励8.26 ± 0.15,显著优于简单智能体(7.72 ± 0.19)。
  • 知识型智能体2(使用Complex嵌入)在测试阶段将平均步数减少至39.75 ± 0.86,表明探索减少且规划更高效。
  • 即使步数更少,知识型智能体仍获得更高平均奖励(8.11 ± 0.18),优于改进型智能体(8.04 ± 0.17),表明策略质量更优。
  • 知识整合在训练与测试阶段均使奖励较改进型智能体稳定提升0.3–0.5分。
  • 外部知识的使用降低了性能方差,表现为奖励与步数指标的标准误差更小。
  • 结果表明,来自ConceptNet等开放源的知识嵌入能有效提升强化学习智能体在文本环境中的推理与决策能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。