Skip to main content
QUICK REVIEW

[论文解读] WordCraft: An Environment for Benchmarking Commonsense Agents

Minqi Jiang, Jelena Luketina|arXiv (Cornell University)|Jul 17, 2020
Topic Modeling参考文献 42被引用 10
一句话总结

WordCraft 在 Little Alchemy 2 的基础上构建了一个快速、轻量级的强化学习环境,用于评估智能体的常识推理能力。通过将实体与自然语言对齐,并利用 ComplEx 链接预测整合知识图谱,该环境显著提升了无知识图谱基线模型的零样本泛化能力,实现了高效的训练与评估。

ABSTRACT

The ability to quickly solve a wide range of real-world tasks requires a commonsense understanding of the world. Yet, how to best extract such knowledge from natural language corpora and integrate it with reinforcement learning (RL) agents remains an open challenge. This is partly due to the lack of lightweight simulation environments that sufficiently reflect the semantics of the real world and provide knowledge sources grounded with respect to observations in an RL environment. To better enable research on agents making use of commonsense knowledge, we propose WordCraft, an RL environment based on Little Alchemy 2. This lightweight environment is fast to run and built upon entities and relations inspired by real-world semantics. We evaluate several representation learning methods on this new benchmark and propose a new method for integrating knowledge graphs with an RL agent.

研究动机与目标

  • 为解决缺乏轻量级、语义丰富的强化学习环境,以真实世界概念为知识基础的问题。
  • 实现对利用自然语言和知识图谱中的常识知识的智能体的高效基准测试。
  • 探究预训练知识图谱嵌入如何提升强化学习智能体在零样本泛化中的表现。
  • 开发并评估一种基于 ComplEx 链接得分对强化学习策略进行知识图谱预测条件化的方法。

提出的方法

  • WordCraft 作为一个马尔可夫决策过程构建,包含 700 个实体和 3,417 种有效物品组合,模拟基于 Little Alchemy 2 的合成游戏。
  • 通过自然语言语义对实体进行对齐,实现与外部知识源(如 ConceptNet)的匹配。
  • 在有效配方的知识图谱上训练 ComplEx 模型,以预测实体之间的缺失关系。
  • 策略网络使用 ComplEx 预测的关系得分(例如 combinesWith、componentOf)和自注意力权重的加权和,以指导动作选择。
  • 该方法将智能体的策略基于知识图谱嵌入进行条件化,使其能够泛化到未见过的组合。
  • 评估采用在不同干扰项数量下的深度 1 和深度 2 任务中的零样本成功率,对比知识图谱增强与无知识图谱的智能体。

实验结果

研究问题

  • RQ1在符号推理环境中,知识图谱嵌入是否能提升强化学习智能体的零样本泛化能力?
  • RQ2关系得分的选择(例如 combinesWith 与 componentOf)如何影响策略性能和动作选择?
  • RQ3在未见任务泛化中,完整知识图谱相较于部分或无知识,其优势有多大?
  • RQ4与无外部知识的端到端强化学习相比,ComplEx 预测得分的整合效果如何?
  • RQ5即使未显式集成知识,模型性能是否会随着训练数据的增加而提升?

主要发现

  • 通过 ComplEx 访问完整知识图谱显著提升了零样本成功率,尤其在低干扰项设置下表现更优。
  • 仅使用 'combinesWith' 关系得分的全知识图谱智能体取得了较高的成功率,但有时会因自组合预测而重复选择同一实体。
  • 部分知识图谱智能体并未始终优于无知识图谱智能体,表明强化学习智能体可仅从数据中学习到部分关系归纳偏置。
  • 知识图谱增强智能体在训练初期表现更优,能比无知识图谱基线更快达到更高的零样本成功率。
  • 'componentOf' 关系得分导致次优行为,常使智能体重复选择同一实体,倾向于选择目标最可能的组成部分。
  • 人类在 1 个和 8 个干扰项下的表现保持稳定,表明人类推理对模糊性具有鲁棒性,而部分模型行为则不然。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。