Skip to main content
QUICK REVIEW

[论文解读] Automatic Evaluation of Attribution by Large Language Models

Xiang Yue, Boshi Wang|arXiv (Cornell University)|May 10, 2023
Topic Modeling被引用 4
一句话总结

本文提出AttrScore,一种用于大语言模型(LLMs)归因自动评估的框架,将错误分类为可归因、推断性与矛盾三类。通过在问答、事实核查、自然语言推理和摘要任务的改写数据上,采用少样本提示和微调较小语言模型的方法进行评估,取得了合理性能,但暴露出在处理细粒度信息与符号运算方面的挑战。

ABSTRACT

A recent focus of large language model (LLM) development, as exemplified by generative search engines, is to incorporate external references to generate and support its claims. However, evaluating the attribution, i.e., verifying whether the generated statement is fully supported by the cited reference, remains an open problem. Although human evaluation is common practice, it is costly and time-consuming. In this paper, we investigate the automatic evaluation of attribution given by LLMs. We begin by defining different types of attribution errors, and then explore two approaches for automatic evaluation: prompting LLMs and fine-tuning smaller LMs. The fine-tuning data is repurposed from related tasks such as question answering, fact-checking, natural language inference, and summarization. We manually curate a set of test examples covering 12 domains from a generative search engine, New Bing. Our results on this curated test set and simulated examples from existing benchmarks highlight both promising signals and challenges. We hope our problem formulation, testbeds, and findings will help lay the foundation for future studies on this important problem.

研究动机与目标

  • 为解决大语言模型归因评估缺乏可扩展、自动化的评估方法这一问题,该问题在生成式搜索等应用中对可信性至关重要。
  • 提出一种细粒度的归因错误分类体系——可归因、推断性与矛盾,超越二元或粗粒度分类。
  • 开发并评估两种自动评估方法:使用 LLM 进行少样本提示,以及在相关 NLP 任务数据上微调小型模型。
  • 构建一个来自 New Bing 的 12 个真实世界领域的全新测试集,以避免数据污染并实现可靠评估。
  • 识别自动归因评估中的关键失败模式,如忽略上下文线索及错误处理数值比较。

提出的方法

  • 提出一个三类归因错误分类体系:(1) 可归因(参考内容完全支持该主张),(2) 推断性(参考内容支持不足),(3) 矛盾(与参考内容直接矛盾)。
  • 设计一种零样本提示方法,使用 LLM(如 ChatGPT)结合少样本示例,对归因类型进行分类。
  • 在来自问答、事实核查、自然语言蕴含和摘要任务的合成与改写数据集上,微调小型语言模型。
  • 从实际 New Bing 查询中整理出 12 个真实世界领域的全新测试集,以确保评估保真度并避免基准数据泄露。
  • 使用人工标注的黄金标准评估模型预测结果,重点关注错误类型分类与失败模式分析。
  • 分析误分类模式,识别重复出现的失败模式,如对数值、日期和符号运算的不敏感。

实验结果

研究问题

  • RQ1能否通过在细粒度错误分类体系上使用 LLM 的少样本提示,实现可靠的自动归因评估?
  • RQ2与提示方法相比,基于改写数据微调小型语言模型在归因分类中的有效性如何?
  • RQ3自动归因评估中的主要失败模式是什么?它们如何与模型行为相关?
  • RQ4与合成或基准数据相比,使用生成式搜索引擎中的真实世界查询在多大程度上提升了评估的有效性?
  • RQ5模型在检测细微错误(如数值不匹配或上下文误读)方面的表现如何?

主要发现

  • 基于提示的 LLM 方法在整理后的测试集上表现合理,但因忽略上下文线索而频繁失败,占错误总数的 79.4%。
  • 对细粒度信息的不敏感,如未能比较数值或日期,导致了 13.8% 的误分类。
  • 符号运算失败(如验证作者身份或集合成员关系)占错误的 6.8%,表明逻辑推理能力存在局限。
  • 微调模型在处理细微语义差异方面表现出更强的鲁棒性,尽管在复杂案例中性能仍不理想。
  • 两种方法在需要精确比较数量或时间细节的参考内容上均表现不佳,凸显了自动归因中的关键挑战。
  • 来自 New Bing 的整理测试集揭示了与现有基准之间显著的分布差异,验证了真实世界评估数据的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。