Skip to main content
QUICK REVIEW

[论文解读] Reasoning on Knowledge Graphs with Debate Dynamics

Marcel Hildebrandt, Jorge Andres Quintero Serna|arXiv (Cornell University)|Jan 2, 2020
Topic Modeling参考文献 23被引用 6
一句话总结

该论文提出R2D2,一种新颖的知识图谱推理方法,将三元组分类问题建模为两名强化学习智能体之间的辩论,分别生成支持某一事实为真(正题)或为假(反题)的可解释路径(论据)。一名二分类器(裁判)评估这些论据,实现在FB15k-237和WN18RR数据集上的最先进性能,同时提供人类可理解的解释,其在准确率、AUC和hits@k指标上均优于基线方法。

ABSTRACT

We propose a novel method for automatic reasoning on knowledge graphs based on debate dynamics. The main idea is to frame the task of triple classification as a debate game between two reinforcement learning agents which extract arguments -- paths in the knowledge graph -- with the goal to promote the fact being true (thesis) or the fact being false (antithesis), respectively. Based on these arguments, a binary classifier, called the judge, decides whether the fact is true or false. The two agents can be considered as sparse, adversarial feature generators that present interpretable evidence for either the thesis or the antithesis. In contrast to other black-box methods, the arguments allow users to get an understanding of the decision of the judge. Since the focus of this work is to create an explainable method that maintains a competitive predictive accuracy, we benchmark our method on the triple classification and link prediction task. Thereby, we find that our method outperforms several baselines on the benchmark datasets FB15k-237, WN18RR, and Hetionet. We also conduct a survey and find that the extracted arguments are informative for users.

研究动机与目标

  • 开发一种具备内在透明性的知识图谱推理方法,同时保持高预测性能。
  • 通过提供可解释、可追溯的论据,支持人机协同决策。
  • 在标准知识图谱补全任务(包括三元组分类和链接预测)上对方法进行基准测试。
  • 通过用户调查评估所提取论据的人类可解释性。
  • 探究智能体之间的辩论机制是否能同时提升知识图谱推理的可解释性与性能。

提出的方法

  • 两名强化学习智能体分别作为正题(事实为真)与反题(事实为假)的辩护者。
  • 每个智能体遍历知识图谱,提取稀疏的、基于路径的论据以支持其立场。
  • 一名二分类器(裁判)评估论据,并仅基于路径证据做出最终真值判断。
  • 智能体通过强化学习进行训练,奖励基于裁判的最终预测结果。
  • 该方法使用实体和关系嵌入来引导路径搜索,但最终论据集的判断完全依赖裁判的决策。
  • 该框架支持人工审查论据,从而实现对模型决策的潜在覆盖或优化。

实验结果

研究问题

  • RQ1两名对抗性智能体之间的辩论机制是否能同时提升知识图谱推理的可解释性与预测性能?
  • RQ2智能体提取的论据是否具有信息量且符合人类直觉?
  • RQ3R2D2模型在三元组分类与链接预测任务上是否达到与最先进基线方法相当的性能?
  • RQ4裁判的决策在多大程度上依赖于智能体提供的论据的质量与相关性?
  • RQ5能否通过人类对论据质量与决策一致性的评估来验证模型的可解释性?

主要发现

  • 在FB15k-237和WN18RR数据集上,R2D2在三元组分类任务的准确率、PR AUC和ROC AUC指标上全面优于所有基线方法。
  • 在FB15k-237的一个子集上,R2D2在链接预测任务中表现具有竞争力,MRR、平均排名和hits@k指标与基线相当或更优。
  • 在用户调查中,10位受访者中有9位仅凭提取的论据即正确分类了陈述,且人类与模型决策在所有情况下保持一致。
  • 当用户报告高信心时,分类准确率达到89%,而信心较低时下降至68.4%,表明论据质量与决策可靠性密切相关。
  • 消融实验表明,辩论机制按预期运作:仅考虑单个智能体的论据会使正样本预测增加18.8%或减少70.2%,具体取决于所选智能体。
  • 模型对数据偏差具有鲁棒性,且可解释的论据有助于识别并可能排除有偏见的证据以影响决策。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。