Skip to main content
QUICK REVIEW

[논문 리뷰] Benchmarking the Abilities of Large Language Models for RDF Knowledge Graph Creation and Comprehension: How Well Do LLMs Speak Turtle?

Johannes Frey, Lars‐Peter Meyer|arXiv (Cornell University)|2023. 09. 29.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델(LLM)이 터틀 구문을 사용하여 RDF 지식 그래프 작업을 수행하는 데 평가하기 위한 자동화된 프레임워크인 LLM-KG-Bench를 소개한다. 이 프레임워크는 8개의 LLM에 대해 5개의 작업—지식 그래프 파싱, 생성, 추론—을 평가하며, GPT-4와 Claude 1.3가 가장 뛰어난 성능을 보였지만, 모든 모델이 출력 형식 제약을 자주 위반하여 실용적 사용성에 손상을 주는 것으로 드러났다. 이는 강력한 이해 능력에도 불구하고 그렇다.

ABSTRACT

Large Language Models (LLMs) are advancing at a rapid pace, with significant improvements at natural language processing and coding tasks. Yet, their ability to work with formal languages representing data, specifically within the realm of knowledge graph engineering, remains under-investigated. To evaluate the proficiency of various LLMs, we created a set of five tasks that probe their ability to parse, understand, analyze, and create knowledge graphs serialized in Turtle syntax. These tasks, each embodying distinct degrees of complexity and being able to scale with the size of the problem, have been integrated into our automated evaluation system, the LLM-KG-Bench. The evaluation encompassed four commercially available LLMs - GPT-3.5, GPT-4, Claude 1.3, and Claude 2.0, as well as two freely accessible offline models, GPT4All Vicuna and GPT4All Falcon 13B. This analysis offers an in-depth understanding of the strengths and shortcomings of LLMs in relation to their application within RDF knowledge graph engineering workflows utilizing Turtle representation. While our findings show that the latest commercial models outperform their forerunners in terms of proficiency with the Turtle language, they also reveal an apparent weakness. These models fall short when it comes to adhering strictly to the output formatting constraints, a crucial requirement in this context.

연구 동기 및 목표

  • 대규모 언어 모델(LLM)이 터틀 구문을 사용하여 RDF 지식 그래프를 이해하고 생성하며 다룰 수 있는 능력을 평가하는 것.
  • 상용 및 오픈소스 LLM의 강점과 약점을 공식적인 지식 그래프 엔지니어링 워크플로우 환경에서 파악하는 것.
  • 문제 크기에 따라 확장 가능하고 다양한 LLM을 지원할 수 있는 자동화된 벤치마킹 프레임워크(LLM-KG-Bench)를 개발하고 검증하는 것.
  • LLM이 생성한 터틀 출력에서 의미적 이해와 문법적 정확성 사이의 격차를 조사하는 것.
  • 특히 지식 그래프 파싱 및 유효한 RDF 데이터 생성에서 LLM을 보조자로 활용할 수 있는지 탐색하는 것.

제안 방법

  • 저자는 LLM의 터틀 구문 평가를 위해 다섯 가지 자동화된 벤치마크 작업을 설계했다: T1(연결 설명), T2(오류 탐지), T3(샘플 생성), T4(친구 수 추론), T5(팩트 추출).
  • LLM-KG-Bench 프레임워크는 오류 내성적인 파서와 통합되어 문법적으로 잘못된 터틀 출력을 탐지하고 점수를 매기며, 형식 오류가 있더라도 강력한 평가가 가능하도록 한다.
  • 평가에는 GPT-3.5, GPT-4, Claude 1.3, Claude 2.0와 같은 상용 LLM 4종과 GPT4All Vicuna, GPT4All Falcon 13B와 같은 오픈소스 오프라인 모델 2종을 포함하며, 입력 크기가 다양하게 설정된다.
  • 작업들은 복잡도가 증가하는 방향으로 설계되어, 모델이 점차 증가하는 구조적 및 의미적 요구 조건에 어떻게 반응하는지 분석할 수 있도록 한다.
  • 파싱 실패 히وري스틱은 파싱 불가능한 출력을 식별하며, F1 점수와 정확도 지표는 의미적 정확성과 문법적 타당성을 평가한다.
  • 이 프레임워크는 다양한 LLM API와 통합 가능하며, 지식 그래프 엔지니어링 분야에서 LLM 능력을 재현 가능하고 자동화된 방식으로 평가할 수 있도록 한다.
(a) T1 - Connected Path
(a) T1 - Connected Path

실험 결과

연구 질문

  • RQ1LLM은 RDF 지식 그래프의 유효한 터틀 구문을 얼마나 잘 이해하고 생성하는가?
  • RQ2명시적인 지침에도 불구하고 LLM이 터틀 출력 시 문법적 제약을 얼마나 잘 준수하는가?
  • RQ3다양한 LLM 아키텍처와 크기에서 성능과 신뢰성이 어떻게 달라지며, 특히 입력 복잡도가 증가할 경우 어떻게 변화하는가?
  • RQ4모델 출처(상용 대비 오픈소스)가 지식 그래프 작업에서 정확성과 형식 일관성에 어떤 영향을 미치는가?
  • RQ5LLM-KG-Bench와 같은 자동화된 벤치마킹 프레임워크는 공식적인 지식 표현 작업에서 LLM 능력을 효과적으로 측정하고 비교하는 데 유용한가?

주요 결과

  • GPT-4와 Claude 1.3는 전반적으로 가장 뛰어난 성능을 보였으며, 특히 T5(팩트 추출)와 T4(추론) 작업에서 두각을 나타내었지만, 출력 형식 제약을 자주 위반하였다.
  • Claude 2.0는 소형 및 중형 입력에서 친구 수 작업(T4)에서 다른 모델보다 뛰어난 성능을 보였지만, 대용량 입력에서는 실패했으며, 일반적으로 생략 기호나 잘못된 추론을 사용하였다.
  • GPT-3.5와 GPT-4는 T5(팩트 추출)에서 유사한 성능을 보였지만, GPT-4는 더 높은 중앙값 F1 점수에도 불구하고 더 많은 파싱 불가 출력을 생성하여 실질적 유용성이 떨어졌다.
  • Vicuna와 Falcon 13B는 성능이 열악했다: Vicuna는 필수적인 rdf:type 문장을 생략하고 생략 기호를 사용했으며, Falcon은 반복적인 난잡한 문자열을 생성하고 유효한 터틀 문서를 계속하지 못했다.
  • 모든 모델, 특히 GPT-4와 Claude 1.3와 같은 최신 모델이 예상보다 빈번하게 출력 형식 제약을 위반했으며, 명시적으로 유일하게 터틀을 출력하도록 지시한 경우에도 마찬가지였다.
  • 이 연구는 LLM이 지식 그래프의 의미적 구조를 잘 이해하고 있음에도 불구하고, 그 문법적 신뢰성은 여전히 RDF 워크플로우에 직접 통합하는 데 주요 장벽임을 확인한다.
(b) T2 - Turtle Fixing
(b) T2 - Turtle Fixing

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.