Skip to main content
QUICK REVIEW

[論文レビュー] Developing a Scalable Benchmark for Assessing Large Language Models in Knowledge Graph Engineering

Lars‐Peter Meyer, Johannes Frey|arXiv (Cornell University)|Aug 31, 2023
Topic Modeling被引用数 4
ひとこと要約

本稿では、知識グラフ工学(KGE)タスクにおける大規模言語モデル(LLM)の評価を目的としたモジュラーでスケーラブルなベンチマークフレームワーク、LLM-KG-Benchを紹介する。このフレームワークは、構文の修正、事実抽出、合成データセット生成の3つのコアチャレンジにおけるLLMの自動評価を支援し、LLMが有望ではあるが、特に構文的・構造的正確性においてゼロショットKGEで一貫性に欠けることが示された。

ABSTRACT

As the field of Large Language Models (LLMs) evolves at an accelerated pace, the critical need to assess and monitor their performance emerges. We introduce a benchmarking framework focused on knowledge graph engineering (KGE) accompanied by three challenges addressing syntax and error correction, facts extraction and dataset generation. We show that while being a useful tool, LLMs are yet unfit to assist in knowledge graph generation with zero-shot prompting. Consequently, our LLM-KG-Bench framework provides automatic evaluation and storage of LLM responses as well as statistical data and visualization tools to support tracking of prompt engineering and model performance.

研究の動機と目的

  • 知識グラフ工学(KGE)タスクにおけるLLMのための標準化され、自動化された評価フレームワークの不足に対処すること。
  • さまざまなKGEワークロードにわたる、設定可能なタスクサイズを備えた、継続的かつ再現可能なLLMのベンチマーク評価を可能にすること。
  • 永続的な結果の保存と可視化を通じて、モデルのパフォーマンスおよびプロンプト工学の成果を追跡すること。
  • 特に構文的正確性と構造的整合性において、現在のLLMがゼロショットKGEで示す限界を特定すること。
  • KGE固有のベンチマークおよびモデル比較のコミュニティ主導の拡張基盤を構築すること。

提案手法

  • モデルのインタラクションを抽象化する専用のベンチマークタスクおよびLLMモデルコネクタを備えたモジュラーなフレームワークを設計する。
  • LLMコネクタのための標準化された`generate_text`インターフェースを実装し、一貫したプロンプトの送信と応答収集を可能にする。
  • タスク固有の評価関数を定義し、三元組一致のF1スコアやオブジェクト数の偏差に対する正規化誤差といったスコアを計算する。
  • 問題サイズ(例:エンティティ数)を設定可能にすることで、コンテキスト長がLLMパフォーマンスに与える影響を調査する。
  • seabornを用いた統計解析とトレンド追跡を通じて、結果の永続化と可視化を統合する。
  • 対話ベースの評価を可能にするために、フィードバックに基づいてLLMが応答を段階的に修正できるタスクを設計する。
Figure 1 : Basic LLM-KG-Bench framework architecture. The Benchmark runner takes a benchmark configuration and organizes the repeated execution of benchmark tasks with LLM model connectors and given size parameters. Results generated get stored and can be visualized.
Figure 1 : Basic LLM-KG-Bench framework architecture. The Benchmark runner takes a benchmark configuration and organizes the repeated execution of benchmark tasks with LLM model connectors and given size parameters. Results generated get stored and can be visualized.

実験結果

リサーチクエスチョン

  • RQ1最先端のLLMは、Turtle形式の知識グラフにおける構文的誤りをどの程度正しく修正できるか?
  • RQ2LLMは、PDFから抽出された非構造化テキストから、有効なRDF/Turtle形式の構造的事実をどの程度正確に抽出できるか?
  • RQ3LLMは、指定されたエンティティ数および関係数を持つ合成知識グラフをどの程度信頼性高く生成できるか?
  • RQ4入力またはターゲットの知識グラフのサイズが、さまざまなKGEタスクにおけるLLMパフォーマンスにどのように影響するか?
  • RQ5自動化されたベンチマークフレームワーク(例:LLM-KG-Bench)は、ゼロショットKGEシナリオにおけるモデルの一貫性の欠如を検出および定量化できるか?

主な発見

  • GPT-3.5はTurtle構文の修正を依頼された際、空の応答を頻繁に返し、正しくないと主張する誤りによりF1スコアが0となった。
  • Claude-1.3とGPT-4はGPT-3.5よりTurtle誤り修正で優れた性能を示したが、GPT-4は平均F1スコアは高かったものの、パース不能な出力がより多かった。
  • GPTモデルは、Claude-1.3よりテキストからの事実抽出で高いF1スコアを達成したが、GPT-4のパフォーマンスは1つの高品質な応答によって歪められていた。
  • GPT-3.5は事実抽出においてより一貫した出力品質を示し、パース不能な応答が一切なかったため、平均F1が低くても中央値F1が優れていた。
  • 合成データセット生成において、ターゲットサイズが大きくなるにつれて人物数の相対誤差が増加した。GPT-4は分散が大きく、ターゲット数からの逸脱も多かった。
  • フレームワークは、特にオブジェクト数の正確性において、問題サイズの増加に伴うパフォーマンス劣化を効果的に捉えた。これはコンテキスト長の制限が顕著に現れていることを示している。
(a) Turtle Fixing
(a) Turtle Fixing

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。