Skip to main content
QUICK REVIEW

[論文レビュー] Benchmarking the Abilities of Large Language Models for RDF Knowledge Graph Creation and Comprehension: How Well Do LLMs Speak Turtle?

Johannes Frey, Lars‐Peter Meyer|arXiv (Cornell University)|Sep 29, 2023
Topic Modeling被引用数 4
ひとこと要約

本稿では、Turtle構文を用いたRDF知識グラフタスクにおける大規模言語モデル(LLM)の評価を自動的に行うためのフレームワーク、LLM-KG-Benchを紹介する。このフレームワークは、8体のLLMを対象に、パース、生成、知識グラフ上の推論の5つのタスクをベンチマーク化しており、GPT-4とClaude 1.3が最も優れた性能を示したが、すべてのモデルが出力形式の制約を頻繁に違反しており、強力な理解能力にもかかわらず実用的利用価値が損なわれていることが明らかになった。

ABSTRACT

Large Language Models (LLMs) are advancing at a rapid pace, with significant improvements at natural language processing and coding tasks. Yet, their ability to work with formal languages representing data, specifically within the realm of knowledge graph engineering, remains under-investigated. To evaluate the proficiency of various LLMs, we created a set of five tasks that probe their ability to parse, understand, analyze, and create knowledge graphs serialized in Turtle syntax. These tasks, each embodying distinct degrees of complexity and being able to scale with the size of the problem, have been integrated into our automated evaluation system, the LLM-KG-Bench. The evaluation encompassed four commercially available LLMs - GPT-3.5, GPT-4, Claude 1.3, and Claude 2.0, as well as two freely accessible offline models, GPT4All Vicuna and GPT4All Falcon 13B. This analysis offers an in-depth understanding of the strengths and shortcomings of LLMs in relation to their application within RDF knowledge graph engineering workflows utilizing Turtle representation. While our findings show that the latest commercial models outperform their forerunners in terms of proficiency with the Turtle language, they also reveal an apparent weakness. These models fall short when it comes to adhering strictly to the output formatting constraints, a crucial requirement in this context.

研究の動機と目的

  • 大規模言語モデル(LLM)がTurtle構文を用いてRDF知識グラフを理解・作成・操作できる能力を評価すること。
  • 商業的およびオープンソースのLLMが、形式的な知識グラフ工学ワークフローにおいて、それぞれの強みと弱みを特定すること。
  • 問題サイズに応じてスケーラブルであり、多様なLLMをサポートできる自動化されたベンチマーキングフレームワーク(LLM-KG-Bench)の開発および検証すること。
  • LLMが出力するTurtle形式の文書において、意味的理解と文法的正しさの間のギャップを調査すること。
  • LLMを知識グラフ工学パイプラインのアシスタントとして使用する可能性を検討すること、特にパースと有効なRDFデータの生成に焦点を当てる。

提案手法

  • 著者らは、T1(接続の説明)、T2(エラー検出)、T3(サンプル生成)、T4(友人数の推論)、T5(事実抽出)という5つの自動ベンチマーキングタスクを設計し、Turtle構文におけるLLMの能力を評価した。
  • LLM-KG-Benchフレームワークは、構文的に無効なTurtle出力を検出・スコアリングできる耐障害性を持つパーサーと統合されており、形式的エラーが発生しても堅牢な評価が可能である。
  • 評価には、GPT-3.5、GPT-4、Claude 1.3、Claude 2.0という4体の商業的LLMに加え、GPT4All VicunaとGPT4All Falcon 13Bという2体のオープンソースでオフライン実行可能なモデルを用い、入力サイズの異なるケースを含めた。
  • タスクは複雑性を段階的に増やせるよう設計されており、構造的および意味的要件の増加に伴うモデルの挙動を分析可能である。
  • パース不能な出力を特定するための「パース失敗ヒューリスティック」と、F1スコアおよび正答性メトリクスを用いて意味的正確性と文法的正しさを評価した。
  • このフレームワークは複数のLLM APIとの統合をサポートし、知識グラフ工学分野におけるLLMの能力を再現可能かつ自動的に評価できる。
(a) T1 - Connected Path
(a) T1 - Connected Path

実験結果

リサーチクエスチョン

  • RQ1LLMは、RDF知識グラフのTurtle構文をどれほど正しく理解・生成できるか?
  • RQ2明示的な指示にもかかわらず、LLMが出力するTurtle形式が文法的制約をどれほど守っているか?
  • RQ3モデルのアーキテクチャやサイズに応じて、性能と信頼性はどのように変化するか、特に入力複雑度の増加に伴ってどうなるか?
  • RQ4モデルの出典(商業的 vs オープンソース)が、知識グラフタスクにおける正答性と形式の一貫性に与える影響は何か?
  • RQ5LLM-KG-Benchのような自動化されたベンチマーキングフレームワークは、形式的な知識表現タスクにおけるLLMの能力を効果的に測定・比較できるか?

主な発見

  • GPT-4とClaude 1.3は、T5(事実抽出)やT4(推論)において特に優れた全体的なパフォーマンスを示したが、出力形式の制約を頻繁に違反していた。
  • Claude 2.0は、小規模および中規模の入力では友人数タスク(T4)で他を上回ったが、大規模な入力では失敗し、省略記号や誤った推論を多用する傾向にあった。
  • GPT-3.5とGPT-4はT5(事実抽出)で類似したパフォーマンスを示したが、GPT-4はより多くの無効な出力を生成し、中央値のF1スコアが高かっただけでなく、実効的利用価値が低下していた。
  • VicunaとFalcon 13Bは低いパフォーマンスを示した:Vicunaは必須のrdf:typeステートメントを省略し、省略記号を多用した。Falconは繰り返しの無意味なテキストを生成し、有効なTurtle文書の継続に失敗した。
  • GPT-4 や Claude 1.3 といった最新のモデルですら、明示的に「Turtleのみ出力すること」と指示しても、想定以上に形式の制約に違反する頻度が高く、予想以上に深刻な問題であった。
  • 本研究は、LLMが知識グラフの意味論を十分に理解している一方で、その文法的信頼性がRDFパイプラインへの直接統合における主要なブottleneckであることを確認した。
(b) T2 - Turtle Fixing
(b) T2 - Turtle Fixing

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。