Skip to main content
QUICK REVIEW

[논문 리뷰] Leveraging LLMs in Scholarly Knowledge Graph Question Answering

Tilahun Abedissa Taffa, Ricardo Usbeck|Multilingual Matters (Channel View Publications)|2023. 11. 16.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 소수 예시 프롬프팅을 활용한 학술 지식 그래프 질의 응답(Scholarly Knowledge Graph Question Answering, KGQA) 접근법을 제시한다. 이 방법은 BERT 기반 문장 인코더를 사용해 유사한 훈련 질문과 그에 해당하는 SPARQL 쿼리를 검색하고, 이를 소수 예시로 활용해 대규모 언어 모델(Vicuna-13B)을 프롬프팅하여 SPARQL 생성을 수행한다. 시스템은 Scholarly-QALD-23 챌린지의 SciQA 벤치마크에서 99.0%의 F1 스코어를 기록하여 2위를 달성했다.

ABSTRACT

This paper presents a scholarly Knowledge Graph Question Answering (KGQA) that answers bibliographic natural language questions by leveraging a large language model (LLM) in a few-shot manner. The model initially identifies the top-n similar training questions related to a given test question via a BERT-based sentence encoder and retrieves their corresponding SPARQL. Using the top-n similar question-SPARQL pairs as an example and the test question creates a prompt. Then pass the prompt to the LLM and generate a SPARQL. Finally, runs the SPARQL against the underlying KG - ORKG (Open Research KG) endpoint and returns an answer. Our system achieves an F1 score of 99.0%, on SciQA - one of the Scholarly-QALD-23 challenge benchmarks.

연구 동기 및 목표

  • 제한된 애너테이션된 학술 KGQA 데이터를 보완하기 위해 대규모 언어 모델을 활용한 소수 예시 프롬프팅을 도입한다.
  • 학술 지식 그래프의 SPARQL 쿼리 생성을 향상시키기 위해 의미적 유사도와 LLM의 인라인 학습을 융합한다.
  • ORKG의 학술 메타데이터에 일반화 가능한 강력한, 사전 훈련이 없는 KGQA 파이프라인을 개발한다.
  • 소수 예시 프롬프팅의 수(1개, 3개, 5개)가 SPARQL 생성 정확도에 미치는 영향을 평가한다.
  • Scholarly-QALD-23 챌린지에서 상위 시스템 중 하나로 순위를 확보한다.

제안 방법

  • 시험 질문과 훈련 질문 간의 의미적 유사도를 계산하기 위해 BERT 기반 문장 인코더를 사용하여 유사도가 높은 상위-n개의 예제를 검색한다.
  • 상위-n개의 검색된 질문-SPARQL 쌍을 시험 질문과 결합하여 LLM용 프롬프트를 구성한다.
  • LLM(Vicuna-13B)는 검색된 예제와 시험 질문을 기반으로 소수 예시 설정에서 SPARQL 쿼리를 생성하도록 프롬프팅된다.
  • 생성된 SPARQL 쿼리는 ORKG SPARQL 엔드포인트에 대해 실행되어 답변을 검색한다.
  • LLM이 URI를 기억할 필요를 줄이기 위해 템플릿 기반 SPARQL 생성을 사용하며, 대신 접두사 기반 식별자(예: orkgc, orkgp)에 의존한다.
  • 파이프라인은 Scholarly-QALD-23 챌린지의 SciQA 벤치마크에서 F1 스코어를 주요 평가 지표로 사용하여 평가된다.
Figure 1: SPARQL queries generated by ChatGPT 3.5 in a zero-shot manner for querying Wikidata (left) and ORKG (right).
Figure 1: SPARQL queries generated by ChatGPT 3.5 in a zero-shot manner for querying Wikidata (left) and ORKG (right).

실험 결과

연구 질문

  • RQ1제한된 훈련 데이터를 가진 학술 지식 그래프에 대해 대규모 언어 모델을 활용한 소수 예시 프롬프팅이 정확한 SPARQL 쿼리를 효과적으로 생성할 수 있는가?
  • RQ2소수 예시의 수(1개, 3개, 5개)가 학술 KGQA 환경에서 SPARQL 생성 정확도에 어떤 영향을 미치는가?
  • RQ3BERT를 활용한 의미적 유사도 검색이 SPARQL 생성을 위한 소수 예시 기반 LLM 프롬프팅에 얼마나 기여하는가?
  • RQ4학술 지식 그래프(예: ORKG)에 적용했을 때 LLM이 생성한 SPARQL 쿼리에서 주요 오류 유형은 무엇인가?
  • RQ5실제 학술 질문에 대해 기존 베이스라인 대비 시스템의 성능은 어떻게 평가되는가? (Scholarly-QALD-23 챌린지에서)

주요 결과

  • 시스템은 SciQA 테스트 세트에서 99.0%의 F1 스코어를 기록하여 Scholarly-QALD-23 챌린지 랭킹에서 2위를 달성했다.
  • 3-shot 및 5-shot 프롬프팅 설정에서 각각 개발 세트에서 23개, 25개의 null 시스템 답변이 발생했으며, 이 중 7개, 7개는 문법 오류로 인한 것이었다.
  • 괄호 누락, 잘못된 구두점 사용 등의 문법 오류는 개발 세트에서 3-shot 및 5-shot 설정 모두에서 7개의 SPARQL에 영향을 미치는 주요 실패 원인이었다.
  • 키워드 매칭 오류는 LLM이 문자열 리터럴에서 정확한 간격이나 대소문자를 유지하지 못했을 때 발생하여 null 결과를 초래했다.
  • 복잡한 질문을 오해한 경우—예를 들어 데이터셋 URI를 찾는 대신 그 위치를 찾는 경우—정확하지 않은 SPARQL가 생성되어 잘못된 엔티티를 대상으로 하거나 MAX()와 같은 핵심 연산자를 누락하는 경우가 있었다.
  • 골드 답변이 null인 질문들로 인해 모델의 성능이 크게 영향을 받았으며, 개발 세트에 14개의 이러한 질문이 존재했고, 모든 프롬프팅 설정에서 null 시스템 답변으로 이어졌다.
Figure 2: The Scholarly KGQA model.
Figure 2: The Scholarly KGQA model.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.