Skip to main content
QUICK REVIEW

[論文レビュー] Rethinking Language Models as Symbolic Knowledge Graphs

Vishwas Mruthyunjaya, Pouya Pezeshkpour|arXiv (Cornell University)|Aug 25, 2023
Topic ModelingComputer Science被引用数 3
ひとこと要約

この論文は、対称性、階層構造、合成性などの属性を対象とする9つの新しいベンチマークを導入することで、大規模言語モデル(LMs)が記号的知識グラフ(KGs)の位相的・意味的性質を再現できるかどうかを再評価する。事実の記銘は強いものの、GPT-4を含むLMsはこれらのベンチマークでわずか23.7%のhit@1を達成しており、構造的関係知識を捉える能力に顕著な制限があることが明らかになった。また、小規模なモデルの方が大規模なモデルよりも優れる場合もある。

ABSTRACT

Symbolic knowledge graphs (KGs) play a pivotal role in knowledge-centric applications such as search, question answering and recommendation. As contemporary language models (LMs) trained on extensive textual data have gained prominence, researchers have extensively explored whether the parametric knowledge within these models can match up to that present in knowledge graphs. Various methodologies have indicated that enhancing the size of the model or the volume of training data enhances its capacity to retrieve symbolic knowledge, often with minimal or no human supervision. Despite these advancements, there is a void in comprehensively evaluating whether LMs can encompass the intricate topological and semantic attributes of KGs, attributes crucial for reasoning processes. In this work, we provide an exhaustive evaluation of language models of varying sizes and capabilities. We construct nine qualitative benchmarks that encompass a spectrum of attributes including symmetry, asymmetry, hierarchy, bidirectionality, compositionality, paths, entity-centricity, bias and ambiguity. Additionally, we propose novel evaluation metrics tailored for each of these attributes. Our extensive evaluation of various LMs shows that while these models exhibit considerable potential in recalling factual information, their ability to capture intricate topological and semantic traits of KGs remains significantly constrained. We note that our proposed evaluation metrics are more reliable in evaluating these abilities than the existing metrics. Lastly, some of our benchmarks challenge the common notion that larger LMs (e.g., GPT-4) universally outshine their smaller counterparts (e.g., BERT).

研究の動機と目的

  • 言語モデル(LMs)が、対称性、階層構造、双方向性といった、知識グラフ(KGs)の位相的および意味的属性を再現できるかどうかを評価すること。
  • 既存の評価フレームワークには、孤立した三項対に焦点が当たっており、推論に不可欠な構造的および関係的性質を無視しているというギャップを是正すること。
  • KG表現の複雑さをよりよく捉えるために、属性固有の新しいベンチマークと評価指標を開発すること。
  • 大規模なLMsが構造的知識を捉える際に、常に小規模なモデルを上回るという仮定に疑問を呈すること。
  • 将来のモデル開発および外部知識との統合を支援するため、多様な関係的パターンを網羅的に評価すること。

提案手法

  • T-RExデータセットに基づき、Wikidataから抽出した三項対を用いて、対称性、非対称性、階層構造、双方向性、合成性、経路、エンティティ中心性、バイアス、曖昧性といった、KGの主要な属性を表す9つの新しい定性的ベンチマークを構築した。
  • 各ベンチマークに特化した新たな評価指標を設計し、標準的なprecision@1にとどまらず、関係的理解を評価できるようにした。
  • BERT、LLaMA、GPT-4を含むさまざまなLMsを、パラフレーズ化されたプロンプトを用いて、すべてのベンチマークで評価し、知識抽出の耐性を確保した。
  • エンティティの人気度に応じてGPT-4のパフォーマンスを分析し、正しく予測された例の分布と全体の例の分布を比較することで、事実記銘に依存しているのか、構造的理解に依存しているのかを評価した。
  • 各例に複数の関連する事実が含まれる制御された評価設定を採用し、孤立した三項対ではなく、関係的パターンの推論を要するようにした。
  • 統計的分析を適用して、ベンチマーク間でのモデルパフォーマンスを比較し、とくに人気の高いエンティティにおいて顕著な失敗モードを特定した。

実験結果

リサーチクエスチョン

  • RQ1言語モデルは、知識グラフにおける対称的・非対称的関係を正確に捉えることができるか。また、記号的KGと比較して、そのパフォーマンスはいかがなっているか?
  • RQ2LMsは、KGにおける複雑な推論に不可欠な階層的および合成的構造をどの程度表現できるか?
  • RQ3モデルのサイズは、KGの関係的および位相的属性に関するパフォーマンスに一貫して相関しているか?
  • RQ4エンティティの人気度と語義の曖昧さは、構造的知識タスクにおけるLM予測の信頼性にどのように影響するか?
  • RQ5標準的なprecisionベースの指標よりも、新規の評価指標はLMの構造的理解をより的確に捉えられるか?

主な発見

  • GPT-4は提案されたベンチマークでhit@1が23.7%にとどまり、標準的なLAMAベンチマークの50%のprecision@1と比べて顕著に低い。これは、関係的構造を十分に捉えていないことを示唆している。
  • BERT や LLaMA といった小規模なLMsは、対称性 や 合成性 といった特定のベンチマークでGPT-4を上回るパフォーマンスを示しており、大規模モデルが常に優れるという仮定に疑問を呈している。
  • 正しく予測された例のエンティティの人気度分布が、全体の分布とよく一致していることから、GPT-4の成功は、主に人気のある事実の記憶に依存しているわけではないことが示唆された。
  • 非常に人気の高いエンティティを含む例では、GPT-4が困難を示しており、ある人気度の閾値を超えるとパフォーマンスに限界が生じることを示している。
  • 提案された属性固有の指標は、標準的なprecision@1よりも、LMにおける関係的および位相的知識の評価において信頼性が高く、より情報をもたらす。
  • モデルは異なる属性に対して一貫性のない行動を示しており、単純な関係では高いパフォーマンスを示すが、経路ベースや双方向の推論タスクでは顕著な失敗を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。