Skip to main content
QUICK REVIEW

[논문 리뷰] ChatGPT versus Traditional Question Answering for Knowledge Graphs: Current Status and Future Directions Towards Knowledge Graph Chatbots

Reham Omar, Omij Mangukiya|arXiv (Cornell University)|2023. 02. 08.
Topic Modeling인용 수 38
한 줄 요약

이 논문은 KG 대화형 언어 모델(ChatGPT 및 Galactica)을 KGQA 시스템 KGQAn 및 EDGQA와 비교해 네 개의 실제 지식 그래프를 대상으로 프레임워크를 제시하고 KG 챗봇의 향후 연구 방향을 제시한다.

ABSTRACT

Conversational AI and Question-Answering systems (QASs) for knowledge graphs (KGs) are both emerging research areas: they empower users with natural language interfaces for extracting information easily and effectively. Conversational AI simulates conversations with humans; however, it is limited by the data captured in the training datasets. In contrast, QASs retrieve the most recent information from a KG by understanding and translating the natural language question into a formal query supported by the database engine. In this paper, we present a comprehensive study of the characteristics of the existing alternatives towards combining both worlds into novel KG chatbots. Our framework compares two representative conversational models, ChatGPT and Galactica, against KGQAN, the current state-of-the-art QAS. We conduct a thorough evaluation using four real KGs across various application domains to identify the current limitations of each category of systems. Based on our findings, we propose open research opportunities to empower QASs with chatbot capabilities for KGs. All benchmarks and all raw results are available1 for further analysis.

연구 동기 및 목표

  • 대화형 AI 모델(예: ChatGPT, Galactica)의 강점과 한계를 지식 그래프를 위한 전통적 KG 질문 응답 시스템(KGQAn, EDGQA)과 비교 평가한다.
  • 일관된 프레임워크를 사용해 일반 및 학문 도메인에서의 네 개의 실제 KG에서 성능을 평가한다.
  • 대화형 AI와 KGQA를 결합해 KG 챗봇 구현에 필요한 역량을 식별한다.
  • 대화 가능하고 최신 정보를 제공하는 KG QA 시스템의 개방형 연구 과제를 제시한다.

제안 방법

  • 일관된 비교 프레임워크를 정의하고 정확성, 강건성, 결정성, 설명 가능성, 질의 이해, 최신 정보 반영, 도메인 일반성을 포함한 기준을 설정한다.
  • 평가를 위한 두 가지 대표적 대화 모델(ChatGPT, Galactica)과 두 가지 KGQA 시스템(KGQAn, EDGQA)을 선택한다.
  • QALD-9, YAGO, DBLP, MAG의 네 개의 실제 KG에 대해 불리언, 목록화, WH 형식 및 보다 복잡한 질의를 포괄하는 450개의 영어 질의를 사용해 평가한다.
  • 출력 형식 차이로 인한 언어 모델에 대해서는 인간 평가를 수행하고, 정확도 측정에는 마이크로 F1 및 관련 지표를 사용한다.
  • 여러 개의 ChatGPT 변형(Default, Follow up, Excel)을 테스트해 재현성 및 목록 완성에 미치는 영향을 연구한다.
  • 질의를 반복하여 결정성을 비교하고, 철자/문법扰乱에 따른 강건성 평가를 수행하며, 설명 가능성과 질의 이해를 분석한다.

실험 결과

연구 질문

  • RQ1ChatGPT 및 Galactica가 일반 도메인 및 학문 도메인에서 KG 기반 질의에 응답하는 데 있어 KGQA 시스템과 어떻게 비교되는가?
  • RQ2정확도, 재현율, 정밀도 및 설명 가능성 측면에서 대화형 AI와 전통적 KGQA의 강점과 약점은 무엇인가?
  • RQ3자연어 모델과 KGQA 기법의 조합으로 도메인 전반의 일반성과 최근 정보 반영성을 더 높일 수 있는가?
  • RQ4대화형 KG 챗봇 개발을 위한 대화 지원, 강건성, 설명 가능성, 최신 정보 제공을 가능하게 하는 미해결 과제는 무엇인가?

주요 결과

  • KGQAn은 일반 및 학문 KG에서 높은 정밀도와 재현율을 달성하여 강력한 도메인 일반성을 보인다.
  • ChatGPT는 QALD-9 및 YAGO에서 KGQAn보다 더 높은 정밀도를 달성하지만 특히 긴 목록에서 재현율이 낮아지는 경향이 있다.
  • ChatGPT 변형(Excel, Follow up)은 재현율과 목록 완성을 개선하며, 특정 벤치마크에서 때로는 KGQAn을 능가한다.
  • Galactica는 목록 질문에서 성능이 저조하고 재현율이 전반적으로 낮다.
  • ChatGPT는 높은 설명 가능성과 강건성을 보여주는 반면, 전통적 KGQA 시스템은 결정적이고 최신 정보를 빠르게 조회할 수 있지만 설명이 부족하다.
  • KGQAn은 KG 전반에 걸쳐 강력한 성능을 유지하고 주어진 KG로부터 최신 정보를 빠르게 반영하는 것을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.