Skip to main content
QUICK REVIEW

[論文レビュー] Reasoning on Knowledge Graphs with Debate Dynamics

Marcel Hildebrandt, Jorge Andres Quintero Serna|arXiv (Cornell University)|Jan 2, 2020
Topic Modeling参考文献 23被引用数 6
ひとこと要約

本稿では、三重項分類を、事実の真( thesis )または偽( antithesis )を主張する二つの強化学習エージェント間の討論として定式化する、R2D2 と呼ばれる知識グラフ推論の新規手法を提案する。各エージェントは解釈可能な経路(議論)を生成し、二値分類器(ジャッジ)がそれらの議論を評価することで、FB15k-237 および WN18RR で最先端の性能を達成するとともに、人間が理解可能な根拠を提供する。この手法は、精度、AUC、hits@k メトリクスにおいてベースラインを上回る。

ABSTRACT

We propose a novel method for automatic reasoning on knowledge graphs based on debate dynamics. The main idea is to frame the task of triple classification as a debate game between two reinforcement learning agents which extract arguments -- paths in the knowledge graph -- with the goal to promote the fact being true (thesis) or the fact being false (antithesis), respectively. Based on these arguments, a binary classifier, called the judge, decides whether the fact is true or false. The two agents can be considered as sparse, adversarial feature generators that present interpretable evidence for either the thesis or the antithesis. In contrast to other black-box methods, the arguments allow users to get an understanding of the decision of the judge. Since the focus of this work is to create an explainable method that maintains a competitive predictive accuracy, we benchmark our method on the triple classification and link prediction task. Thereby, we find that our method outperforms several baselines on the benchmark datasets FB15k-237, WN18RR, and Hetionet. We also conduct a survey and find that the extracted arguments are informative for users.

研究の動機と目的

  • 予測性能を維持しつつ統合的透明性を備えた知識グラフ推論手法の開発。
  • 予測のための解釈可能で追跡可能な議論を提供することで、人間による意思決定支援を可能にする。
  • 三重項分類およびリンク予測を含む標準的な知識グラフ補完タスクにおける手法のベンチマーク化。
  • ユーザー調査を通じて抽出された議論の解釈可能性を評価する。
  • エージェント間の議論ダイナミクスが、知識グラフ推論における説明可能性と性能の両面で向上をもたらすかを調査する。

提案手法

  • 二つの強化学習エージェントが、与えられた三重項の真( thesis )または偽( antithesis )を主張する立場として作用する。
  • 各エージェントは知識グラフを走査し、自らの立場を支持するスパarsな経路ベースの議論を抽出する。
  • 二値分類器(ジャッジ)が議論を評価し、最終的な真偽の判断を経路の証拠に基づいて下す。
  • エージェントは、ジャッジの最終予測結果に基づいた報酬を得る強化学習により訓練される。
  • 経路探索をガイドするためのエンティティおよび関係の埋め込みを用いるが、最終的な議論集合の判断はジャッジの判断に依存する。
  • フレームワークは、人間による議論のレビューをサポートしており、モデルの意思決定の上書きや精練が可能である。

実験結果

リサーチクエスチョン

  • RQ1二つの敵対的エージェント間の議論ダイナミクスが、知識グラフ推論における説明可能性と予測性能の両面で向上をもたらすか。
  • RQ2エージェントが抽出した議論は情報量が多く、人間の直感と整合しているか。
  • RQ3R2D2 モデルは、三重項分類およびリンク予測タスクにおいて、最先端のベースラインと比較して競争力のある性能を達成するか。
  • RQ4ジャッジの判断が、エージェントが提供する議論の質および関連性にどの程度依存しているか。
  • RQ5議論の質と意思決定の整合性に関する人間評価を通じて、モデルの解釈可能性を検証できるか。

主な発見

  • R2D2 は、三重項分類における精度、PR AUC、ROC AUC において、FB15k-237 および WN18RR のすべてのベースライン手法を上回った。
  • FB15k-237 のサブセットにおいて、R2D2 はリンク予測でも競争力のある性能を示し、MRR、平均順位、hits@k メトリクスでベースラインと同等またはそれを上回った。
  • ユーザー調査では、抽出された議論に基づくだけで、10件中9件の文が回答者によって正しく分類され、全ケースで人間とモデルの意思決定が一致した。
  • ユーザーが意思決定に対して高い自信を示した場合、分類精度は 89% に達したが、自信が低い場合には 68.4% に低下し、議論の質が意思決定の信頼性と相関していることが示された。
  • アブレーションスタディの結果、議論ダイナミクスは期待通りに機能している:片方のエージェントの議論のみを考慮すると、正例予測が 18.8% 増加するか、70.2% 減少するか、エージェントに依存して変動した。
  • モデルの性能はデータバイアスに対して頑健であり、解釈可能な議論により、意思決定からバイアスのある証拠を特定し、排除する可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。