Skip to main content
QUICK REVIEW

[論文レビュー] An Open Challenge for Inductive Link Prediction on Knowledge Graphs

Mikhail Galkin, Max Berrendorf|arXiv (Cornell University)|Mar 3, 2022
Advanced Graph Neural Networks被引用数 11
ひとこと要約

本論文は、2つの大規模なWikidataベースのデータセットを用いた知識グラフにおける誘導的リンク予測のオープンチャレンジ、ILPC 2022を紹介する。2つのベースライン(GNNを用いる・用いないNodePiece)を提案し、関係ベースのトークン化がゼロショット性能を高めることを示している。一方で、GNNはより大きなグラフにおいて性能を向上させるが、誘導的GNNの一般化に関する未解決の課題が浮き彫りになる。

ABSTRACT

An emerging trend in representation learning over knowledge graphs (KGs) moves beyond transductive link prediction tasks over a fixed set of known entities in favor of inductive tasks that imply training on one graph and performing inference over a new graph with unseen entities. In inductive setups, node features are often not available and training shallow entity embedding matrices is meaningless as they cannot be used at inference time with unseen entities. Despite the growing interest, there are not enough benchmarks for evaluating inductive representation learning methods. In this work, we introduce ILPC 2022, a novel open challenge on KG inductive link prediction. To this end, we constructed two new datasets based on Wikidata with various sizes of training and inference graphs that are much larger than existing inductive benchmarks. We also provide two strong baselines leveraging recently proposed inductive methods. We hope this challenge helps to streamline community efforts in the inductive graph representation learning area. ILPC 2022 follows best practices on evaluation fairness and reproducibility, and is available at https://github.com/pykeen/ilpc2022.

研究の動機と目的

  • 知識グラフにおける誘導的リンク予測のための大規模で再現可能なベンチマークの不足に対処すること。
  • 従来の誘導的でない手法を超えて、効率的で一般化可能な誘導的表現学習モデルの開発を支援すること。
  • コミュニティ全体での比較を可能にする公平で透明性があり再現可能なメトリクスを提供する標準化された評価フレームワークを構築すること。
  • 公開データセットとランクイングボードを提供することで、誘導的GNNおよびエンティティ表現学習分野におけるイノベーションを促進すること。

提案手法

  • 訓練と推論グラフが接続されており、未観測のエンティティを含む完全に誘導的な設定を持つ2つのWikidataベースのデータセット(ILPC22-S および ILPC22-L)を構築した。
  • エンティティをその関係に沿って符号化するためのNodePieceを用い、エンティティ固有の埋め込みを必要としない関係ベースのトークン化スキームを構築した。
  • 2つのベースラインを実装した:単純なNodePieceモデル(-GNN)と、CompGCNを用いたGNN強化版(+GNN)で、スコアリングにはDistMultを採用した。
  • トレーニングには自己適応的ネガティブサンプリング損失(NSSAL)とAdam最適化を適用し、モデル間でハイパーパrameterを固定した。
  • 評価の公平性を確保するため、サンプリングされたネガティブ例に限定せず、推論グラフ内のすべてのエンティティを対象にランク付けした。
  • チャレンジを公開GitHubリポジトリを通じて提供し、ランクイングボードと標準化されたトレーニング/推論プロトコルを整備した。

実験結果

リサーチクエスチョン

  • RQ1既存の誘導的リンク予測モデルは、Wikidataのような大規模で現実世界の知識グラフにおいて、どの程度の性能を示すのか?
  • RQ2NodePieceによる関係ベースのトークン化は、エンティティ固有の埋め込みを用いずに強力な誘導的一般化を達成できるか?
  • RQ3単体のNodePieceと比較して、GNNは大規模な誘導的リンク予測タスクにおいてどの程度性能を向上させるのか?
  • RQ4現在の誘導的モデルは、大規模なグラフにおける未観測エンティティに対して、計算コストと性能の面でどの程度スケーリング可能なのか?
  • RQ5誘導的リンク予測ベンチマーク評価において、再現性と公平性を高めるために重要な設計選択は何か?

主な発見

  • 単純なNodePieceベースライン(-GNN)は、ILPC22-SでHits@100が0.4678、ILPC22-Lで0.287を達成し、メッセージパッシングを一切行わないにもかかわらず高い再現性を示した。
  • GNN強化ベースライン(+GNN)は、ILPC22-SでMRRを0.0381から0.1326に向上させ、小さなグラフでは顕著な性能向上を示した。
  • より大きなILPC22-Lデータセットでは、MRRの向上はより限定的(0.0651から0.0705に)にとどまり、現在のGNNが誘導的設定でスケーラビリティに限界を示している可能性を示唆した。
  • +GNNベースラインをILPC22-Lでトレーニングするには480分と3GBのVRAMを要し、大規模グラフにおける計算的負荷が顕著に現れた。
  • ILPC22-Sでは+GNNのAMRIスコアが0.730と高く、モデルの信頼性が確認されたが、ILPC22-Lでは0.682に低下し、改善の余地があることが示された。
  • 推論エンティティをすべて対象にランク付けするチャレンジの評価プロトコルは、サンプリングベースのベースラインと比較して、より意味的で解釈可能なメトリクスを提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。