Skip to main content
QUICK REVIEW

[論文レビュー] A Unified Framework for Rank-based Evaluation Metrics for Link Prediction in Knowledge Graphs

Charles Tapley Hoyt, Max Berrendorf|arXiv (Cornell University)|Mar 14, 2022
Advanced Graph Neural Networks被引用数 8
ひとこと要約

本稿では、知識グラフリンク予測におけるランクベースの評価指標について、統一的な理論的枠組みを提案する。MRRの調整版(AMRR)やzスコア化された指標(ZMRR)といった改善された指標を導入することで、データセットサイズが異なる場合の解釈可能性と比較可能性が向上する。一般化平均と確率的補正を活用することで、従来のMRRがデータセットサイズに偏っていることが示され、本稿の新しい指標は、モデルや知識グラフ間でのより正確で有意義な性能差を明らかにする。

ABSTRACT

The link prediction task on knowledge graphs without explicit negative triples in the training data motivates the usage of rank-based metrics. Here, we review existing rank-based metrics and propose desiderata for improved metrics to address lack of interpretability and comparability of existing metrics to datasets of different sizes and properties. We introduce a simple theoretical framework for rank-based metrics upon which we investigate two avenues for improvements to existing metrics via alternative aggregation functions and concepts from probability theory. We finally propose several new rank-based metrics that are more easily interpreted and compared accompanied by a demonstration of their usage in a benchmarking of knowledge graph embedding models.

研究の動機と目的

  • 知識グラフリンク予測における既存のランクベース評価指標の解釈可能性と比較可能性の欠如に対処すること。
  • ランクベース指標の理論的基盤を構築し、体系的な分析と改善を可能にすること。
  • データセットサイズに依存しない、AMRR、ZMRR、HMRといった新しい指標を提案すること。
  • 異なるサイズや特性を持つ多様なデータセット間で、知識グラフ埋め込みモデル(KGEMs)の公平なベンチマークを可能にすること。
  • 新しい指標のオープンソース実装をPyKEENに提供し、再現可能な評価を可能にすること。

提案手法

  • 一般化されたべき乗平均に基づく理論的枠組みを提案し、ランクベース評価指標を統一的に分析する。
  • より高いロバスト性を実現するための代替集約関数(例:調和平均ランク(HMR)、幾何平均ランク(GMR)、逆数平均ランク(IMR))を導入する。
  • 極端値への感受性を低減し、解釈可能性を向上させるために、逆数や幾何平均といったランク変換を適用する。
  • ランクがランダムに与えられた場合の期待値と分散を用いて、確率的補正(例:AMRR、ZMRR)を導出することで、データセット間での指標の正規化を実現する。
  • zスコア正規化を用いることで、ランダムな性能を基準として標準化し、異なる知識グラフ間での指標値の直接比較を可能にする。
  • PyKEEN v1.8.0に、期待値と分散の閉形式解が可能な限り実装されている。

実験結果

リサーチクエスチョン

  • RQ1どのようにして、サイズが異なるデータセット間で、知識グラフリンク予測のランクベース評価指標をより解釈可能かつ比較可能にすることができるか?
  • RQ2MRR や HK といった既存の指標が示す理論的性質は何か? また、データセットサイズの変動に伴って、それらの指標はどのように崩壊するのか?
  • RQ3代替集約関数(例:調和平均、幾何平均、逆数平均)が、よりロバストで意味のある評価スコアを生み出すことができるか?
  • RQ4確率的補正(例:zスコア、調整済み平均)は、モデル比較における公平性と有意性をどの程度向上させるのか?
  • RQ5新しい指標は、従来のMRRが隠蔽していた性能差をどの程度明らかにするのか?

主な発見

  • 従来のMRRはデータセットサイズと強い逆相関を示しており、これはサイズに偏りがあることを示唆し、異なる知識グラフ間での比較が不適切であることを意味する。
  • 調整済みMRR(AMRR)とzスコア化MRR(ZMRR)は、サイズバイアスを完全に除去し、データセット間でのモデル性能の公平な比較を可能にする。
  • Nationsデータセットでは、ComplExはMRRで競争力があるように見えるが、AMRRとZMRRではWN18-RRと比べて著しく性能が低いことが明らかになった。
  • MRRではNationsでTuckERが優れているように見えるが、AMRRとZMRRでは、実際にはより大きなWN18-RRデータセットでより良い性能を発揮していることが判明した。
  • zスコア化指標は、小さなデータセット(Kinships、Nations)で高いMRRスコアを達成した場合、大きなデータセット(WN18-RR、FB15k-237)でのスコアと比べて統計的に有意ではないことを示している。
  • 新しい指標はPyKEEN v1.8.0に実装されており、期待値と分散の閉形式解が可能であり、効率的かつ標準化された評価が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。