[论文解读] Developing a Scalable Benchmark for Assessing Large Language Models in Knowledge Graph Engineering
本文提出了 LLM-KG-Bench,一个模块化、可扩展的基准框架,用于评估大型语言模型(LLMs)在知识图谱工程(KGE)任务中的表现。该框架支持对 LLM 在三个核心挑战——语法修正、事实抽取和合成数据集生成——中的表现进行自动化评估,表明尽管 LLM 展现出潜力,但在零样本 KGE 任务中仍存在不一致性,尤其是在语法和结构准确性方面。
As the field of Large Language Models (LLMs) evolves at an accelerated pace, the critical need to assess and monitor their performance emerges. We introduce a benchmarking framework focused on knowledge graph engineering (KGE) accompanied by three challenges addressing syntax and error correction, facts extraction and dataset generation. We show that while being a useful tool, LLMs are yet unfit to assist in knowledge graph generation with zero-shot prompting. Consequently, our LLM-KG-Bench framework provides automatic evaluation and storage of LLM responses as well as statistical data and visualization tools to support tracking of prompt engineering and model performance.
研究动机与目标
- 解决知识图谱工程(KGE)任务中 LLM 缺乏标准化、自动化评估框架的问题。
- 通过可配置的任务规模,实现对 LLM 在多样化 KGE 工作负载中持续、可重复的基准测试。
- 通过持久化结果存储和可视化,支持对模型性能和提示工程结果的跟踪。
- 识别当前 LLM 在零样本 KGE 中的局限性,特别是在语法正确性和结构保真度方面。
- 为社区驱动的 KGE 专用基准和模型对比扩展奠定基础。
提出的方法
- 设计一个模块化框架,包含专用的基准任务和抽象模型交互的 LLM 模型连接器。
- 实现标准化的 `generate_text` 接口,供 LLM 连接器使用,以确保提示的一致传递和响应的统一收集。
- 定义特定任务的评估函数,计算如三元组匹配的 F1 分数和对象数量偏差的归一化误差等指标。
- 支持可配置的问题规模(例如实体数量),以研究上下文长度对 LLM 性能的影响。
- 通过 seaborn 集成结果持久化和可视化,支持统计分析和趋势追踪。
- 通过设计允许 LLM 基于反馈迭代修正响应的对话式评估任务,支持对话式评估。

实验结果
研究问题
- RQ1领先的 LLM 在修正 Turtle 格式知识图谱中的语法错误方面表现如何?
- RQ2LLM 能在多大程度上准确地从非结构化、从 PDF 提取的纯文本中抽取结构化事实,并生成有效的 RDF/Turtle 表示?
- RQ3LLM 能在多大程度上可靠地生成指定实体数和关系数的合成知识图谱?
- RQ4输入或目标知识图谱的大小如何影响 LLM 在 KGE 任务中的表现?
- RQ5像 LLM-KG-Bench 这类自动化基准测试框架能否检测并量化零样本 KGE 场景下模型的不一致性?
主要发现
- 当要求修复 Turtle 语法错误时,GPT-3.5 经常返回空响应,导致因错误声称正确而 F1 得分为零。
- Claude-1.3 和 GPT-4 在 Turtle 错误修正任务中优于 GPT-3.5,其中 GPT-4 的平均 F1 更高,但存在更多无法解析的输出。
- GPT 系列模型在从纯文本中抽取事实方面的 F1 分数优于 Claude-1.3,尽管 GPT-4 的表现受单个高质量响应的影响而产生偏差。
- GPT-3.5 在事实抽取任务中表现出更一致的输出质量,未出现无法解析的响应,因此尽管平均 F1 较低,但中位数 F1 更优。
- 在合成数据集生成任务中,目标规模越大,人员数量的相对误差越高,GPT-4 表现出更高的方差和更明显的与目标数量的偏离。
- 该框架成功捕捉到随着问题规模增大导致的性能下降,特别是在对象数量准确性方面,凸显了上下文长度的限制。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。