[논문 리뷰] A Benchmark to Understand the Role of Knowledge Graphs on Large Language Model's Accuracy for Question Answering on Enterprise SQL Databases
이 논문은 기업용 SQL 데이터베이스에서의 대규모 언어 모델(Large Language Model, LLM) 정확도를 평가하기 위한 벤치마크를 소개하며, 지식 그래프(Knowledge Graphs, KGs)를 통합할 경우 성능 향상이 뚜렷하다는 것을 입증한다. GPT-4를 사용해 zero-shot 프롬프팅을 수행한 결과, 원시 SQL에서의 정확도는 16.7%에서 KG 표현 방식을 사용할 경우 54.2%로 상승하여, 기업용 LLM 응용 프로그램의 신뢰성 향상에 지식 그래프가 핵심 요소임을 시사한다.
Enterprise applications of Large Language Models (LLMs) hold promise for question answering on enterprise SQL databases. However, the extent to which LLMs can accurately respond to enterprise questions in such databases remains unclear, given the absence of suitable Text-to-SQL benchmarks tailored to enterprise settings. Additionally, the potential of Knowledge Graphs (KGs) to enhance LLM-based question answering by providing business context is not well understood. This study aims to evaluate the accuracy of LLM-powered question answering systems in the context of enterprise questions and SQL databases, while also exploring the role of knowledge graphs in improving accuracy. To achieve this, we introduce a benchmark comprising an enterprise SQL schema in the insurance domain, a range of enterprise queries encompassing reporting to metrics, and a contextual layer incorporating an ontology and mappings that define a knowledge graph. Our primary finding reveals that question answering using GPT-4, with zero-shot prompts directly on SQL databases, achieves an accuracy of 16%. Notably, this accuracy increases to 54% when questions are posed over a Knowledge Graph representation of the enterprise SQL database. Therefore, investing in Knowledge Graph provides higher accuracy for LLM powered question answering systems.
연구 동기 및 목표
- LLM 기반 SQL 데이터베이스 질문 응답에 대한 기업 중심의 벤치마크 부족 문제를 해결하기 위해.
- 지식 그래프가 기업용 LLM 응용 프로그램에서 환각 현상(Hallucinations)을 줄이고 정확도를 향상시키는 영향을 평가하기 위해.
- 실제 기업 스키마, 복잡한 자연어 질문, 맥락 기반 온톨로지 계층을 포함한 재현 가능한 벤치마크를 제공하기 위해.
- 실제 기업 환경에서 원시 SQL 프롬프팅과 KG 보강된 프롬프팅 간의 성능 격차를 측정하기 위해.
- 미래 연구 및 개발을 이끄는 데 도움이 되기 위해 기업용 LLM 도입의 핵심 과제를 규명하기 위해.
제안 방법
- 벤치마크는 보험 분야의 실제 기업 관계형 스키마인 OMG Property and Casualty (PC) 데이터 모델을 사용하며, 25개의 테이블과 복잡한 외래 키 관계를 포함한다.
- 보고서, 지표, KPI를 포함한 기업 관련 자연어 질문 43개를 포함하며, 질문 및 스키마 복잡도의 네 가지 영역으로 분류된다.
- 비즈니스 개념, 속성, 관계를 정의하는 온톨로지와 SQL 스키마에서 온톨로지로의 매핑을 통해 지식 그래프를 구성하는 맥락 계층을 수립한다.
- 평가에서는 GPT-4를 사용해 zero-shot 프롬프팅을 수행하며, 한 조건은 원시 SQL 데이터베이스에 직접 쿼리하고, 다른 조건은 KG 표현 방식을 사용한다.
- 정확도는 LLM이 생성한 SQL 쿼리와 기준 쿼리 간의 정확한 일치 및 실행 결과 검증을 통해 측정된다.
- 벤치마크는 확장 가능하도록 설계되어 기업에서 자체 스키마, 질문, 맥락 계층을 사용해 결과를 재현할 수 있도록 한다.

실험 결과
연구 질문
- RQ1LLM이 원시 기업용 SQL 데이터베이스를 직접 기반으로 복잡한 기업 관련 자연어 질문에 정확하게 답변할 수 있는 정도는 어느 정도인가?
- RQ2지식 그래프의 통합이 기업용 SQL 데이터베이스에서 LLM 기반 질문 응답의 정확도에 어떤 영향을 미치는가?
- RQ3질문 및 스키마 복잡도의 다양한 수준에서 원시 SQL과 KG 보강된 표현 방식 간의 성능 차이는 어떻게 되는가?
- RQ4비즈니스 맥락 계층(온톨로지 및 매핑 포함)의 사용이 기업용 LLM 응용 프로그램에서 환각 현상을 줄이고 신뢰성을 향상시키는가?
- RQ5제안된 벤치마크는 향후 LLM과 KG 통합의 기업 데이터 시스템 평가를 위한 신뢰할 수 있고 재현 가능한 표준이 될 수 있는가?
주요 결과
- GPT-4를 사용해 zero-shot 프롬프팅을 통해 원시 기업용 SQL 데이터베이스에서 LLM 기반 질문 응답을 수행한 결과, 정확도는 단지 16.7%에 그쳤다.
- 동일한 질문을 데이터베이스의 지식 그래프 표현 방식으로 제시한 결과, 정확도는 54.2%로 상승하여 37.5%포인트의 향상이 이루어졌다.
- 낮은 질문/낮은 스키마 영역에서는 정확도가 원시 SQL에서 25.5%에서 KG로 71.1%로 상승하여 단순한 쿼리에 대해 뚜렷한 성과 향상을 보였다.
- 높은 질문/낮은 스키마 영역에서는 정확도가 원시 SQL에서 37.4%에서 KG로 66.9%로 상승하여, 복잡한 보고서 질문에 대해서도 KG가 유용함을 입증했다.
- 낮은 질문/높은 스키마 영역에서는 정확도가 원시 SQL에서 16.7%에서 KG로 54.2%로 상승하여, 복잡한 스키마 환경에서도 효과적임을 보였다.
- 결과는 지식 그래프가 환각 현상을 크게 줄이고 특히 실제 기업 환경에서 복잡한 상황에서 신뢰성을 향상시킨다는 점을 확인한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.