Skip to main content
QUICK REVIEW

[论文解读] On Exploring the Reasoning Capability of Large Language Models with Knowledge Graphs

Pei-Chi Lo, Yi-Hang Tsai|arXiv (Cornell University)|Dec 1, 2023
Topic Modeling被引用 5
一句话总结

本文通过利用大语言模型(LLMs)的内部知识图谱,研究了其推理能力,表明LLMs能够从上下文中回忆事实性知识并推断多跳关系。GPT-4在上下文路径生成方面表现优于其他模型,表现出更低的幻觉和更高的结构完整性,而多步提示策略则提升了推理准确性。

ABSTRACT

This paper examines the capacity of LLMs to reason with knowledge graphs using their internal knowledge graph, i.e., the knowledge graph they learned during pre-training. Two research questions are formulated to investigate the accuracy of LLMs in recalling information from pre-training knowledge graphs and their ability to infer knowledge graph relations from context. To address these questions, we employ LLMs to perform four distinct knowledge graph reasoning tasks. Furthermore, we identify two types of hallucinations that may occur during knowledge reasoning with LLMs: content and ontology hallucination. Our experimental results demonstrate that LLMs can successfully tackle both simple and complex knowledge graph reasoning tasks from their own memory, as well as infer from input context.

研究动机与目标

  • 评估LLMs是否能够从其预训练的内部知识图谱中回忆事实性知识。
  • 评估LLMs从上下文输入中推断多跳知识图谱关系的能力。
  • 识别并分类在LLM-based知识推理过程中出现的两类幻觉——内容幻觉和本体幻觉。
  • 通过结构化提示策略提升推理性能,尤其针对上下文路径生成等复杂任务。
  • 为在无需外部检索的情况下利用LLMs进行知识图谱推理提供基础,尤其适用于专有或未见过的知识库。

提出的方法

  • 在四个知识图谱推理任务(尾实体预测、关系预测、关系抽取和上下文路径生成)中,使用三种LLMs(text-davinci-003、ChatGPT和GPT-4)进行实验。
  • 为非上下文任务(尾实体和关系预测)设计零样本提示,以测试LLMs的内部知识回忆能力。
  • 为上下文路径生成(CPG)引入多步提示策略,包括支持句抽取、实体链接和路径生成子任务。
  • 以DBPedia作为知识图谱来源,并为尾实体和关系预测任务构建包含100个三元组的数据集。
  • 使用NGEO、%IF(不连贯性)和%IV(错误性)等指标评估模型性能,并与最短路径和简单指令提示等基线方法进行比较。
  • 应用AutoCoT(自动思维链)以增强LLMs的推理能力,尤其针对初始结构完整性较低的模型(如ChatGPT)进行优化。
Figure 1. An Example of Contextual Path Generation Task. The query entities $(e_{H},e_{T})$ are colored in red in the context document $d$ .
Figure 1. An Example of Contextual Path Generation Task. The query entities $(e_{H},e_{T})$ are colored in red in the context document $d$ .

实验结果

研究问题

  • RQ1LLMs在多大程度上能够准确回忆其内部知识图谱中的信息?
  • RQ2LLMs在多大程度上能够从上下文输入中推断知识图谱关系?
  • RQ3在LLM-based知识推理过程中,哪些类型的幻觉——内容幻觉或本体幻觉——会出现?
  • RQ4多步提示和先进模型(如GPT-4)在上下文路径生成中的推理性能和幻觉率方面有何影响?

主要发现

  • GPT-4在上下文路径生成中表现最佳,NGEO为0.17,%IF为0.10,%IV为0.18,显著优于text-davinci-003和ChatGPT。
  • 多步提示策略提升了text-davinci-003的推理质量,NGEO从0.37降至0.29,但%IV仍高达0.30。
  • ChatGPT在单步提示下表现出较差的结构完整性(NGEO 0.29,%IF 0.15),但使用AutoCoT后,NGEO降至0.25,%IF降至0.14。
  • 内容幻觉和本体幻觉在复杂任务中持续出现,表明需要更优的提示工程和外部检索机制。
  • 最短路径基线方法达到了最高的结构完整性(NGEO 0.43),但缺乏上下文相关性,凸显了正确性与上下文感知之间的权衡。
  • 像GPT-4这样的LLMs在极少提示工程下即可生成简洁、准确的输出,表明其在正确提示下具备强大的上下文推理能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。