Skip to main content
QUICK REVIEW

[论文解读] Learning Collaborative Agents with Rule Guidance for Knowledge Graph Reasoning

Deren Lei, Gangrong Jiang|arXiv (Cornell University)|May 1, 2020
Advanced Graph Neural Networks参考文献 23被引用 5
一句话总结

本文提出 RuleGuider,一种协作式强化学习框架,通过整合符号规则指导来缓解基于路径的知识图谱推理中的稀疏奖励信号问题。通过将智能体分离为实体和关系子智能体,并利用 AnyBURL 提取的高质量规则进行奖励塑造,RuleGuider 在 WN18RR 和 NELL-995 上实现了最先进性能,同时保持了可解释性并降低了动作空间复杂度。

ABSTRACT

Walk-based models have shown their advantages in knowledge graph (KG) reasoning by achieving decent performance while providing interpretable decisions. However, the sparse reward signals offered by the KG during traversal are often insufficient to guide a sophisticated walk-based reinforcement learning (RL) model. An alternate approach is to use traditional symbolic methods (e.g., rule induction), which achieve good performance but can be hard to generalize due to the limitation of symbolic representation. In this paper, we propose RuleGuider, which leverages high-quality rules generated by symbolic-based methods to provide reward supervision for walk-based agents. Experiments on benchmark datasets show that RuleGuider improves the performance of walk-based models without losing interpretability.

研究动机与目标

  • 解决基于路径的知识图谱推理中的稀疏奖励问题,因为标准强化学习智能体因反馈有限而难以训练。
  • 结合符号规则推理的优势(在某些数据集上具有高准确率)与基于路径的强化学习方法的可解释性。
  • 通过解耦实体和关系选择,减少强化学习智能体的动作空间,提升训练效率。
  • 在实现知识图谱补全任务最先进性能的同时,保持模型的可解释性。
  • 评估规则引导的推理是否能产生更符合人类理解且逻辑上合理的推理路径。

提出的方法

  • RuleGuider 采用双智能体架构:实体智能体和关系智能体协同工作,以在知识图谱中生成推理路径。
  • 该智能体使用一种奖励函数,结合标准的‘命中’信号(密集奖励)与来自预先挖掘的符号规则的规则引导奖励塑造。
  • 符号规则通过 AnyBURL(一种最先进规则挖掘方法)提取,并在训练过程中用于引导强化学习智能体。
  • 通过解耦实体和关系选择,对动作空间进行剪枝,从而减少每一步的可能动作数。
  • 在使用标准强化学习进行微调之前,通过规则引导监督进行预训练阶段,以初始化智能体。
  • 模型使用 ComplEx 嵌入进行奖励塑造和路径评分,确保与现有知识图谱嵌入技术的兼容性。

实验结果

研究问题

  • RQ1符号规则能否显著提升基于路径的强化学习智能体在知识图谱推理中的样本效率和性能?
  • RQ2与标准强化学习基线相比,规则引导的奖励塑造是否能产生更具可解释性和人类可理解的推理路径?
  • RQ3将智能体分离为实体和关系子智能体对性能和动作空间复杂度有何影响?
  • RQ4在不完整知识图谱中,规则引导在多大程度上能补偿稀疏奖励信号的问题?
  • RQ5规则引导是否能在规则质量不同的数据集之间(如 WN18RR 与 FB15k-237)实现良好泛化?

主要发现

  • RuleGuider 在 WN18RR 和 NELL-995 上达到最先进性能,H@1 为 42.9,MRR 为 46.5,优于现有基于路径的方法。
  • 在 FB15k-237 上,RuleGuider 取得具有竞争力的结果(H@1: 42.4,MRR: 46.4),但性能受限于大规模关系空间中规则覆盖稀疏。
  • 在 FB15K-237 上的人工评估显示,63.08% 的投票者更偏好 RuleGuider 的推理路径,表明其具有更好的人类可解释性和逻辑合理性。
  • 消融实验表明,使用规则进行预训练以及智能体分离显著提升性能,而单智能体变体因动作空间过大而表现较差。
  • 模型在训练过程中动态放弃低质量规则,表现为规则使用率从预训练阶段的 45.6% 下降至训练阶段的 32.1%(WN18RR 数据集)。
  • 规则引导的使用减少了对稀疏密集奖励的依赖,使模型在稀疏知识图谱中实现更稳定、更有效的学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。