Skip to main content
QUICK REVIEW

[论文解读] Multi-Dimensional Evaluation of Text Summarization with In-Context Learning

Sameer Jain, Vaishakh Keshava|arXiv (Cornell University)|Jun 1, 2023
Topic Modeling被引用 5
一句话总结

本文提出 Ice,一种无需微调、基于上下文学习的大型语言模型(LLM)多维文本摘要评估框架。通过向 GPT-3 提供少量上下文示例,Ice 在事实一致性与相关性方面达到最先进性能,优于 ROUGE 和 BARTScore 等基于参考的指标,在零样本 GPT-3 摘要中与人类判断的一致性更高,且对上下文示例的选择与数量变化具有鲁棒性。

ABSTRACT

Evaluation of natural language generation (NLG) is complex and multi-dimensional. Generated text can be evaluated for fluency, coherence, factuality, or any other dimensions of interest. Most frameworks that perform such multi-dimensional evaluation require training on large manually or synthetically generated datasets. In this paper, we study the efficacy of large language models as multi-dimensional evaluators using in-context learning, obviating the need for large training datasets. Our experiments show that in-context learning-based evaluators are competitive with learned evaluation frameworks for the task of text summarization, establishing state-of-the-art on dimensions such as relevance and factual consistency. We then analyze the effects of factors such as the selection and number of in-context examples on performance. Finally, we study the efficacy of in-context learning based evaluators in evaluating zero-shot summaries written by large language models such as GPT-3.

研究动机与目标

  • 开发一种无需学习、可扩展的多维文本摘要评估方法,避免依赖大规模标注训练数据集。
  • 评估基于 LLM 的上下文学习是否能在事实一致性与相关性等维度上达到或超越微调评估模型的性能。
  • 评估上下文学习评估器对上下文示例选择与数量变化的鲁棒性。
  • 研究在评估 GPT-3 等模型的零样本摘要时,上下文学习评估器与人类判断的一致性程度。
  • 证明通过上下文学习实现的无参考评估能够比基于参考的指标更好地捕捉人类偏好,尤其适用于非模仿性、零样本生成的摘要。

提出的方法

  • Ice 使用少量上下文示例——每个示例包含一个生成的摘要及其对应的质量评分——作为示范,通过提示大型语言模型(GPT-3 text-davinci-003)进行评估。
  • 提示内容根据评估维度包含源文本、参考摘要(用于相关性)或两者,最后以待评分的测试摘要结尾。
  • 针对每个维度(一致性、相关性、流畅性、连贯性),设计了不同的提示模板,以引导 LLM 在相关上下文中生成 0 到 1 之间的数值评分。
  • 通过解码模型的确定性输出(温度 = 0)并解析生成的数值字符串提取评分。
  • 该框架具有可扩展性:添加新评估维度仅需新增包含少量示例对的提示,无需重新训练。
  • 性能通过标准基准上的人工标注评分进行评估,并与学习型基线(如 BRIO、T0)、ROUGE 和 BARTScore 进行比较。

实验结果

研究问题

  • RQ1基于 LLM 的上下文学习是否能在多维文本摘要评估中实现与微调评估模型相当或更优的性能?
  • RQ2上下文学习评估器的性能对上下文示例选择与数量变化的鲁棒性如何?
  • RQ3在评估 GPT-3 的零样本摘要时,上下文学习评估器(Ice)是否比基于参考的指标更符合人类判断?
  • RQ4Ice 是否可在无需额外微调或大规模人工标注数据的情况下评估新维度?
  • RQ5Ice 在捕捉非参考模仿摘要的人类偏好方面,相较于现有自动指标(如 ROUGE 和 BARTScore)的优越程度如何?

主要发现

  • 在人工评估中,Ice 在事实一致性(0.996)和相关性(0.849)方面达到最先进性能,优于 BRIO 和 T0 等学习型基线。
  • 随着上下文示例数量增加,模型性能略有提升,且在使用均匀或多样化采样方法选择示例时仍保持鲁棒性。
  • 仅使用一个上下文示例时,Ice 的性能已接近弱微调基线,表明预训练带来的强大归纳偏置。
  • Ice 在零样本 GPT-3 摘要上与人类判断高度一致(总体相关性 0.937),而 ROUGE 和 BARTScore 均系统性地低估 GPT-3 摘要的偏好度。
  • Ice 的无参考设计使其能更准确评估 GPT-3 的零样本摘要,因为后者因非模仿性特征而被基于参考的指标所惩罚。
  • 该框架具有可扩展性:添加新评估维度仅需通过少量示例进行提示工程,无需重新训练或生成合成数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。