Skip to main content
QUICK REVIEW

[论文解读] Leveraging LLMs in Scholarly Knowledge Graph Question Answering

Tilahun Abedissa Taffa, Ricardo Usbeck|Multilingual Matters (Channel View Publications)|Nov 16, 2023
Topic Modeling被引用 5
一句话总结

本文提出了一种用于学术知识图谱问答(KGQA)的少样本提示方法,利用基于 BERT 的句子编码器检索与训练问题相似的问题及其 SPARQL 查询,随后将这些结果作为少样本示例,用于提示大型语言模型(Vicuna-13B)生成 SPARQL 查询。该系统在 SciQA 基准测试中取得了 99.0% 的 F1 分数,在 Scholarly-QALD-23 挑战赛中排名第二。

ABSTRACT

This paper presents a scholarly Knowledge Graph Question Answering (KGQA) that answers bibliographic natural language questions by leveraging a large language model (LLM) in a few-shot manner. The model initially identifies the top-n similar training questions related to a given test question via a BERT-based sentence encoder and retrieves their corresponding SPARQL. Using the top-n similar question-SPARQL pairs as an example and the test question creates a prompt. Then pass the prompt to the LLM and generate a SPARQL. Finally, runs the SPARQL against the underlying KG - ORKG (Open Research KG) endpoint and returns an answer. Our system achieves an F1 score of 99.0%, on SciQA - one of the Scholarly-QALD-23 challenge benchmarks.

研究动机与目标

  • 通过利用大型语言模型的少样本提示方法,缓解标注学术 KGQA 数据稀缺的问题。
  • 通过结合语义相似性与 LLM 上下文学习,提升学术知识图谱的 SPARQL 查询生成能力。
  • 开发一种稳健的、无需预训练的 KGQA 管道,使其能泛化于 ORKG 中的学术元数据。
  • 评估单样本、三样本和五样本提示对 SPARQL 生成准确率的影响。
  • 在 Scholarly-QALD-23 挑战赛的 SciQA 基准测试中跻身顶尖系统行列。

提出的方法

  • 使用基于 BERT 的句子编码器计算测试问题与训练问题之间的语义相似度,以检索最相似的前 n 个示例。
  • 将检索到的前 n 个问题-SPARQL 对与测试问题结合,形成 LLM 的提示。
  • 在少样本设置下,向 LLM(Vicuna-13B)提供提示,基于检索到的示例和测试问题生成 SPARQL 查询。
  • 将生成的 SPARQL 查询在 ORKG SPARQL 端点上执行,以检索答案。
  • 系统采用基于模板的 SPARQL 生成方式,减少 LLM 对 URI 的记忆需求,转而依赖前缀标识符(如 orkgc、orkgp)。
  • 使用 F1 分数作为主要指标,在 Scholarly-QALD-23 挑战赛提供的 SciQA 基准测试上评估该管道。
Figure 1: SPARQL queries generated by ChatGPT 3.5 in a zero-shot manner for querying Wikidata (left) and ORKG (right).
Figure 1: SPARQL queries generated by ChatGPT 3.5 in a zero-shot manner for querying Wikidata (left) and ORKG (right).

实验结果

研究问题

  • RQ1在训练数据有限的情况下,使用大型语言模型进行少样本提示能否有效生成正确的 SPARQL 查询以应对学术知识图谱?
  • RQ2在学术 KGQA 场景下,少样本示例的数量(单样本、三样本、五样本)如何影响 SPARQL 生成的准确性?
  • RQ3使用 BERT 进行语义相似性检索在多大程度上能提升少样本 LLM 提示在 SPARQL 生成中的表现?
  • RQ4在 ORKG 等学术 KG 上应用 LLM 生成 SPARQL 查询时,主要的错误类型是什么?
  • RQ5与 Scholarly-QALD-23 挑战赛中的现有基线相比,该系统在真实学术问题上的表现如何?

主要发现

  • 该系统在 SciQA 测试集上取得了 99.0% 的 F1 分数,在 Scholarly-QALD-23 挑战赛排行榜中排名第二。
  • 在开发集上,三样本提示和五样本提示设置分别产生了 23 个和 25 个空系统答案,其中 7 个和 7 个是由于语法错误导致。
  • 语法错误(如缺少右括号或标点符号错误)是主要的失败原因,在开发集的三样本和五样本设置中均影响了 7 个 SPARQL 查询。
  • 当 LLM 未能在字符串字面量中准确保留空格或大小写时,会发生关键词匹配错误,导致返回空结果。
  • 对复杂问题的理解错误(如搜索数据集 URI 而非其位置)会导致生成错误的 SPARQL 查询,错误地针对错误的实体或遗漏关键操作符(如 MAX())。
  • 当问题的黄金答案为 null 时,模型性能受到显著影响,在开发集中有 14 个此类问题,所有提示设置下均产生空系统答案。
Figure 2: The Scholarly KGQA model.
Figure 2: The Scholarly KGQA model.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。