Skip to main content
QUICK REVIEW

[論文レビュー] LambdaKG: A Library for Pre-trained Language Model-Based Knowledge Graph Embeddings

Xin Xie, Zhoubo Li|arXiv (Cornell University)|Oct 1, 2022
Topic Modeling被引用数 5
ひとこと要約

LambdaKG は、事前学習言語モデル(PLM)を用いた知識グラフ埋め込み(KGE)を統合的・オープンソースで実装するためのライブラリであり、知識グラフ補完、質問応答、推薦、知識プローブといった多様なタスクにおいて、識別ベースと生成ベースの両方の手法をサポートする。BERT、BART、T5、GPT-3、ChatGPT を統合し、一貫したトレーニング、評価、最適化ツールを備えたモジュラーで拡張可能なフレームワークを提供し、FB15k-237 や ATOMIC2020 といったベンチマークで最先端の性能を達成している。

ABSTRACT

Knowledge Graphs (KGs) often have two characteristics: heterogeneous graph structure and text-rich entity/relation information. Text-based KG embeddings can represent entities by encoding descriptions with pre-trained language models, but no open-sourced library is specifically designed for KGs with PLMs at present. In this paper, we present LambdaKG, a library for KGE that equips with many pre-trained language models (e.g., BERT, BART, T5, GPT-3), and supports various tasks (e.g., knowledge graph completion, question answering, recommendation, and knowledge probing). LambdaKG is publicly open-sourced at https://github.com/zjunlp/PromptKG/tree/main/lambdaKG, with a demo video at http://deepke.zjukg.cn/lambdakg.mp4 and long-term maintenance.

研究の動機と目的

  • 事前学習言語モデル(PLM)に基づく知識グラフ埋め込み(KGE)に特化した包括的でオープンソースのライブラリが不足しているという問題に応えること。
  • 識別ベースと生成ベースの両方のPLMベースのKGE手法を、一つの拡張可能なフレームワークに統合すること。
  • 知識グラフ補完、質問応答、推薦、知識プローブといった多様な下流タスクをサポートすること。
  • トレーニング、評価、最適化の標準化されたコンponentsを備えたモジュラーで保守可能かつ拡張可能なツールキットを提供し、再現性のある研究を可能にすること。
  • GPT-3 や ChatGPT といった最先端のPLMを用いた、新しいKGE手法のきめ細やかなベンチマークと比較を可能にすること。

提案手法

  • LambdaKG は、知識グラフの三元組を自然言語のプロンプトに変換する統合的KGエンコーダーを採用しており、PLMが構造的および文脈的情報を同時に理解できるようにしている。
  • 主に二つのパラダイムをサポートする:識別ベースのモデル(例:リンク予測のためのBERTの微調整)と生成ベースのモデル(例:T5 や GPT-3 を用いた回答生成)。
  • カスタマイズ可能なトレーニングステップ、損失計算、早期停止を備えたモジュラーな Trainer および Evaluator クラスを提供し、柔軟なトレーニングパイプラインを実現している。
  • Hits@k(k=1,3,10)および平均順位(MR)といった標準的な評価指標、生成タスクには BLEU-1 を実装した Metric クラスを提供している。
  • ラベルスムージング、指数移動平均、top-k ネガティブサンプリング、早期停止といった技術を統合した「トリックのバッグ」モジュールにより、トレーニングの安定性と性能が向上する。
  • 差し替え可能なエンティティ埋め込みモジュールにより、エンティティ表現が強化され、知識プローブタスクにおける事実の再現率が向上している。

実験結果

リサーチクエスチョン

  • RQ1統合的かつオープンソースのライブラリは、複数の下流タスクにわたり、多様なPLMベースのKGE手法を効果的にサポートできるか?
  • RQ2小規模PLM(例:BERT、T5)と大規模言語モデル(例:GPT-3、ChatGPT)は、知識グラフ補完タスクにおいてどのように性能を発揮するか?
  • RQ3GPT-3 や ChatGPT といった生成ベースのモデルは、ゼロショットの知識グラフ補完および質問応答タスクにおいて、識別ベースのモデルをどれほど上回るのか?
  • RQ4外部知識を統合したPLMベースのKGEは、知識プローブタスクにおける事実の再現率を向上させるか?
  • RQ5関係タイプごとの性能差は、特に 1-1 と 1-n のリンク予測シナリオにおいてどのように変化するか?

主な発見

  • LambdaKG は FB15k-237 において競争力のある性能を示し、KGT5 が他のモデルを上回った。
  • ChatGPT は text-davinci-003 よりも FB15k-237 で優れた性能を示し、特に 1-1 リンク予測において高い hits@1 スコアを記録した。
  • 1-1 と 1-n の関係ケースでは性能が著しく低下し、曖昧さやモデルの推論限界のため、複数の末尾エンティティを処理することが困難であることが示された。
  • ATOMIC2020 の常識的知識グラフ補完ベンチマークでは、GPT-3 は限られた性能にとどまり、ChatGPT はより文脈的に適切なが、正確性に欠ける回答を生成した。これは手動スコアリングで確認された。
  • 差し替え可能なエンティティ埋め込みモジュールの統合により、LAMA プローブタスクにおける事実の再現率が向上し、BERT と RoBERTa は顕著な向上を示した。
  • LambdaKG は、PLMが生成する映画の埋め込みを活用することで、ML-20m における順序付き推薦を効果的に実現し、同じ設定下で BERT4Rec を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。