Skip to main content
QUICK REVIEW

[論文レビュー] A Benchmark to Understand the Role of Knowledge Graphs on Large Language Model's Accuracy for Question Answering on Enterprise SQL Databases

Juan Sequeda, Dean Allemang|arXiv (Cornell University)|Nov 13, 2023
Topic Modeling被引用数 7
ひとこと要約

本論文は、企業用SQLデータベース上の質問応答における大規模言語モデル(LLM)の正確性を評価するベンチマークを導入し、知識グラフ(KG)を統合することで性能が顕著に向上することを示している。GPT-4をゼロショットプロンプティングで使用した結果、生のSQLに対する正確性は16.7%から、データベースのKG表現を用いた場合に54.2%に上昇し、KGが信頼性の高い企業向けLLMアプリケーションの実現に不可欠であることが明らかになった。

ABSTRACT

Enterprise applications of Large Language Models (LLMs) hold promise for question answering on enterprise SQL databases. However, the extent to which LLMs can accurately respond to enterprise questions in such databases remains unclear, given the absence of suitable Text-to-SQL benchmarks tailored to enterprise settings. Additionally, the potential of Knowledge Graphs (KGs) to enhance LLM-based question answering by providing business context is not well understood. This study aims to evaluate the accuracy of LLM-powered question answering systems in the context of enterprise questions and SQL databases, while also exploring the role of knowledge graphs in improving accuracy. To achieve this, we introduce a benchmark comprising an enterprise SQL schema in the insurance domain, a range of enterprise queries encompassing reporting to metrics, and a contextual layer incorporating an ontology and mappings that define a knowledge graph. Our primary finding reveals that question answering using GPT-4, with zero-shot prompts directly on SQL databases, achieves an accuracy of 16%. Notably, this accuracy increases to 54% when questions are posed over a Knowledge Graph representation of the enterprise SQL database. Therefore, investing in Knowledge Graph provides higher accuracy for LLM powered question answering systems.

研究の動機と目的

  • LLMを用いたSQLデータベース上の質問応答に向けた、企業向けに整合したベンチマークの不足を解消すること。
  • 知識グラフが企業向けLLMアプリケーションにおける誤り(ホールーシャン)の低減と正確性の向上に与える影響を評価すること。
  • 実際の企業スキーマ、複雑な自然言語質問、文脈的なオントロジー層を備えた再現可能なベンチマークを提供すること。
  • 現実的な企業環境下で、直接SQLプロンプティングとKG拡張プロンプティングの間の性能差を測定すること。
  • 企業向けLLM導入における主な課題を特定することで、今後の研究開発を支援すること。

提案手法

  • ベンチマークは、保険分野における実際の企業リレーショナルスキーマであるOMGプロパティ・アンド・キャリアタル(PC)データモデルを用い、25のテーブルと複雑な外部キー関係を持つ。
  • 報告書、指標、KPIをカバーする43の企業関連の自然言語質問を含み、質問とスキーマの複雑さの観点から4つの象限に分類されている。
  • ビジネスコンセプト、属性、関係を定義するオントロジーを構築し、SQLスキーマからオントロジーへのマッピングを提供することで、知識グラフを構築する。
  • 評価はGPT-4を用い、ゼロショットプロンプティングで実施:一方の条件では生のSQLデータベースに直接問い合わせ、もう一方ではKG表現を用いる。
  • 正確性は、LLMが生成したSQLクエリをゴールスタンダードクエリと比較し、完全一致と実行結果の検証によって測定される。
  • ベンチマークは拡張可能に設計されており、企業が自らのスキーマ、質問、文脈層を用いて結果を再現できる。
Figure 1: P&C Conceptual Model
Figure 1: P&C Conceptual Model

実験結果

リサーチクエスチョン

  • RQ1LLMは、GPT-4をゼロショットプロンプティングで使用した場合、生の企業用SQLデータベース上で複雑で企業関連の自然言語質問にどれほど正確に応答できるか?
  • RQ2知識グラフの統合は、企業用SQLデータベース上のLLMベースの質問応答の正確性にどのように影響するか?
  • RQ3質問およびスキーマの複雑さの異なるレベルにおいて、生のSQLとKG拡張表現を用いたLLMの性能差は何か?
  • RQ4ビジネスコンテキスト層(オントロジーとマッピング)の使用は、企業向けLLMアプリケーションにおけるホールーシャンの低減と信頼性の向上に寄与するか?
  • RQ5提示されたベンチマークは、今後の企業データシステムにおけるLLMとKG統合の評価に、信頼性があり再現可能な基準として機能できるか?

主な発見

  • GPT-4をゼロショットプロンプティングで使用した場合、生の企業用SQLデータベース上でLLMベースの質問応答を実施したところ、正確性はわずか16.7%にとどまった。
  • 同じ質問をデータベースの知識グラフ表現に対して提示した場合、正確性は54.2%に上昇し、37.5ポイントの向上を示した。
  • 低質問/低スキーマの象限では、正確性はSQLの25.5%からKGの71.1%に向上し、単純なクエリにおいて顕著な改善が確認された。
  • 高質問/低スキーマの象限では、正確性はSQLの37.4%からKGの66.9%に上昇し、複雑なレポート質問に対してもKGが有効であることが示された。
  • 低質問/高スキーマの象限では、正確性はSQLの16.7%からKGの54.2%に向上し、複雑なスキーマ環境でも効果を発揮することが確認された。
  • これらの結果は、知識グラフがホールーシャンを顕著に低減し、特に現実的で複雑な企業環境において信頼性を大幅に向上させることを確認した。
Figure 2: Four quadrants to classify questions: (1) Low Question/Low Schema Complexity, (2) High Question/Low Schema Complexity, (3) Low Question/High Schema Complexity, and (4) High Question/High Schema Complexity
Figure 2: Four quadrants to classify questions: (1) Low Question/Low Schema Complexity, (2) High Question/Low Schema Complexity, (3) Low Question/High Schema Complexity, and (4) High Question/High Schema Complexity

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。