Skip to main content
QUICK REVIEW

[논문 리뷰] Developing a Scalable Benchmark for Assessing Large Language Models in Knowledge Graph Engineering

Lars‐Peter Meyer, Johannes Frey|arXiv (Cornell University)|2023. 08. 31.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 지식 그래프 공학(KGE) 작업에서 대규모 언어 모델(LLM)을 평가하기 위한 모듈식이고 확장 가능한 벤치마크 프레임워크인 LLM-KG-Bench를 소개한다. 이 프레임워크는 문법 수정, 사실 추출, 합성 데이터셋 생성의 세 가지 핵심 과제에 대해 자동화된 평가를 지원하며, LLM이 잠재력을 보여주지만 제로샷 KGE에서 일관성 없이 작동함을 입증한다. 특히 문법적 정확성과 구조적 정확성에서 문제가 있다.

ABSTRACT

As the field of Large Language Models (LLMs) evolves at an accelerated pace, the critical need to assess and monitor their performance emerges. We introduce a benchmarking framework focused on knowledge graph engineering (KGE) accompanied by three challenges addressing syntax and error correction, facts extraction and dataset generation. We show that while being a useful tool, LLMs are yet unfit to assist in knowledge graph generation with zero-shot prompting. Consequently, our LLM-KG-Bench framework provides automatic evaluation and storage of LLM responses as well as statistical data and visualization tools to support tracking of prompt engineering and model performance.

연구 동기 및 목표

  • 지식 그래프 공학(KGE) 작업에서 LLM에 대한 표준화되고 자동화된 평가 프레임워크의 부족을 해결한다.
  • 다양한 KGE 워크로드에 걸쳐 구성 가능한 작업 크기로 LLM의 지속적이고 반복 가능한 벤치마킹을 가능하게 한다.
  • 지속적인 결과 저장 및 시각화를 통해 모델 성능과 프롬프트 엔지니어링 결과를 추적할 수 있도록 지원한다.
  • 현재 LLM이 제로샷 KGE에서 문법적 정확성과 구조적 유사성 측면에서 겪는 한계를 특정한다.
  • 커뮤니티 기반의 KGE 전용 벤치마크 및 모델 비교 확장을 위한 기반을 마련한다.

제안 방법

  • 모델 상호작용을 추상화하는 전용 벤치마크 작업과 LLM 모델 커넥터를 갖춘 모듈식 프레임워크를 설계한다.
  • LLM 커넥터에서 일관된 프롬프트 전달 및 응답 수집을 가능하게 하기 위해 표준화된 `generate_text` 인터페이스를 구현한다.
  • 삼중항 일치에 대한 F1 점수 및 개체 수 편차에 대한 정규화된 오차를 계산하는 작업별 평가 함수를 정의한다.
  • 문맥 길이가 LLM 성능에 미치는 영향을 연구하기 위해 구성 가능한 문제 크기(예: 엔터티 수)를 지원한다.
  • seaborn을 사용하여 통계 분석 및 추세 추적을 위한 결과 지속성 및 시각화 기능을 통합한다.
  • 피드백 기반으로 반복적으로 응답을 수정할 수 있도록 설계된 작업을 통해 대화 기반 평가를 가능하게 한다.
Figure 1 : Basic LLM-KG-Bench framework architecture. The Benchmark runner takes a benchmark configuration and organizes the repeated execution of benchmark tasks with LLM model connectors and given size parameters. Results generated get stored and can be visualized.
Figure 1 : Basic LLM-KG-Bench framework architecture. The Benchmark runner takes a benchmark configuration and organizes the repeated execution of benchmark tasks with LLM model connectors and given size parameters. Results generated get stored and can be visualized.

실험 결과

연구 질문

  • RQ1주요 LLM들은 Turtle 형식의 지식 그래프에서 문법 오류를 수정하는 데 얼마나 잘 수행되는가?
  • RQ2LLM은 비정형 텍스트(예: PDF에서 추출한 텍스트)에서 얼마나 정확하게 구조화된 사실을 추출하여 유효한 RDF/Turtle 형식으로 변환할 수 있는가?
  • RQ3LLM은 지정된 엔터티 수와 관계 수를 갖는 합성 지식 그래프를 얼마나 신뢰성 있게 생성할 수 있는가?
  • RQ4입력 또는 대상 지식 그래프의 크기가 KGE 과제 전반에서 LLM 성능에 어떻게 영향을 미치는가?
  • RQ5자동화된 벤치마킹 프레임워크인 LLM-KG-Bench는 제로샷 KGE 시나리오에서 모델의 일관성 없는 성능를 탐지하고 정량화할 수 있는가?

주요 결과

  • GPT-3.5는 Turtle 문법을 수정해 달라는 요청에 자주 빈 응답을 반환하여 잘못된 정확성 주장으로 인해 F1 점수가 0이 되었다.
  • Claude-1.3와 GPT-4는 GPT-3.5보다 Turtle 오류 수정에서 더 뛰어난 성능를 보였으며, GPT-4는 평균 F1 점수는 더 높았지만 파싱 불가능한 출력이 더 많았다.
  • GPT 모델은 Claude-1.3보다 비정형 텍스트에서 사실 추출 시 더 높은 F1 점수를 기록했지만, GPT-4의 성능은 한 개의 고품질 응답으로 인해 왜곡되었다.
  • GPT-3.5는 사실 추출에서 더 일관된 출력 품질을 보였으며, 파싱 불가능한 응답이 없었고, 평균 점수는 낮았지만 중앙값 F1 점수가 더 높았다.
  • 합성 데이터셋 생성 과정에서 대상 크기가 증가할수록 인물 수의 상대 오차가 증가했으며, GPT-4는 더 높은 분산과 목표 수에서의 더 많은 이격을 보였다.
  • 이 프레임워크는 문제 크가 증가함에 따라 성능 저하를 성공적으로 포착했으며, 특히 개체 수 정확도에서의 저하가 드러나며 문맥 길이 제한의 문제점을 강조했다.
(a) Turtle Fixing
(a) Turtle Fixing

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.