Skip to main content
QUICK REVIEW

[论文解读] Large Language Models are Not Yet Human-Level Evaluators for Abstractive Summarization

Chenhui Shen, Liying Cheng|arXiv (Cornell University)|May 22, 2023
Topic Modeling被引用 5
一句话总结

本文评估了大型语言模型(LLMs)如ChatGPT和GPT-4作为抽象摘要自动评估工具的表现,发现尽管其性能优于传统指标,但仍存在不一致和不可靠的问题——尤其在高质量摘要上——这是由于候选摘要和评估维度相关的偏差,以及随着系统质量提升,其与人类判断的相关性下降所致。

ABSTRACT

With the recent undeniable advancement in reasoning abilities in large language models (LLMs) like ChatGPT and GPT-4, there is a growing trend for using LLMs on various tasks. One area where LLMs can be employed is as an alternative evaluation metric for complex generative tasks, which generally demands expensive human judges to complement the traditional automatic metrics for various evaluation dimensions such as fluency and consistency. In this work, we conduct extensive analysis to investigate the stability and reliability of LLMs as automatic evaluators for abstractive summarization. We found that while ChatGPT and GPT-4 outperform the commonly used automatic metrics, they are not ready as human replacements due to significant limitations. That is, LLM evaluators rate each candidate system inconsistently and are dimension-dependent. They also struggle to compare candidates with close performance and become more unreliable with higher-quality summaries by obtaining a lower correlation with humans. In other words, with better abstractive summarization systems being introduced at a fast pace, LLMs may result in misleading and unreliable evaluations.

研究动机与目标

  • 评估LLM是否能够可靠地替代人工标注者来评估抽象摘要系统。
  • 研究基于LLM的评估在不同摘要系统和评估维度上的稳定性和一致性。
  • 识别LLM评估者在区分高性能摘要模型方面的能力局限。
  • 提出一种实用的临时框架,在需要人工验证之前检测不可靠的LLM评估。

提出的方法

  • 采用两种人工评估范式:李克特量表打分(通过直接推理后打分和多项选择题提示)以及一对一(H2H)比较。
  • 使用ChatGPT和GPT-4对12个抽象摘要系统(每个系统生成100个摘要)生成评分和偏好判断。
  • 计算LLM评分与人类专家平均判断在流畅性、连贯性、一致性和相关性维度上的相关性。
  • 引入元相关性度量,以评估LLM可靠性随摘要质量提升而变化的情况。
  • 提出一种通过推理后打分(RTS)与多项选择题(MCQ)方法之间的一致性进行可靠性检查:低一致性表明可能存在不可靠性。
  • 在https://github.com/DAMO-NLP-SG/LLM_summeval发布所有LLM生成结果和代码,以确保可复现性。

实验结果

研究问题

  • RQ1LLM评估者在不同抽象摘要系统中与人类判断的相关性如何?
  • RQ2LLM评估者在不同评估维度上对同一系统评分时,其一致性程度如何?
  • RQ3当比较高质量摘要与低质量摘要时,LLM评估者的表现如何变化?
  • RQ4RTS与MCQ两种提示策略之间的一致性能否作为LLM评估可靠性的可靠指标?
  • RQ5LLM评估中是否存在系统性偏差,导致其评估结果受候选摘要或评估维度的影响?

主要发现

  • LLM评估者(ChatGPT和GPT-4)在与人类判断的相关性方面优于传统自动指标(如ROUGE和BARTScore)。
  • LLM评估者在评分不同候选摘要系统时表现出显著不一致性,表明存在候选依赖性偏差。
  • LLM评估具有维度依赖性,在流畅性、连贯性和一致性维度上与人类判断的对齐程度各不相同。
  • 随着摘要质量提升,LLM评估者与人类判断的相关性反而下降——这一现象被称为负向元相关性。
  • 推理后打分(RTS)与多项选择题(MCQ)提示方法之间的一致性与评估可靠性相关:低一致性提示需要人工验证。
  • 通过RTS-MCQ一致性进行可靠性检查的方法在相关性维度上无效,因为未发现显著相关性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。