Skip to main content
QUICK REVIEW

[论文解读] Calibrating LLM-Based Evaluator

Yuxuan Liu, Tianchi Yang|arXiv (Cornell University)|Sep 23, 2023
Topic ModelingComputer Science被引用 3
一句话总结

本文提出 AutoCalibrate,一种无需梯度、多阶段的框架,用于校准基于大语言模型(LLM)的评估器,以在自然语言生成(NLG)评估中更好地对齐人类偏好。通过利用上下文学习和自-refinement 自动挖掘、优化并改进来自人工标注标签的评分标准,该方法在摘要生成、数据到文本生成以及幻觉检测等任务中显著提升了与专家判断的相关性。

ABSTRACT

Recent advancements in large language models (LLMs) on language modeling and emergent capabilities make them a promising reference-free evaluator of natural language generation quality, and a competent alternative to human evaluation. However, hindered by the closed-source or high computational demand to host and tune, there is a lack of practice to further calibrate an off-the-shelf LLM-based evaluator towards better human alignment. In this work, we propose AutoCalibrate, a multi-stage, gradient-free approach to automatically calibrate and align an LLM-based evaluator toward human preference. Instead of explicitly modeling human preferences, we first implicitly encompass them within a set of human labels. Then, an initial set of scoring criteria is drafted by the language model itself, leveraging in-context learning on different few-shot examples. To further calibrate this set of criteria, we select the best performers and re-draft them with self-refinement. Our experiments on multiple text quality evaluation datasets illustrate a significant improvement in correlation with expert evaluation through calibration. Our comprehensive qualitative analysis conveys insightful intuitions and observations on the essence of effective scoring criteria.

研究动机与目标

  • 解决现成的基于大语言模型的评估器缺乏校准的问题,这些评估器常因评分说明模糊或不一致而与人类偏好产生偏差。
  • 克服基于参考文本的指标(如 BLEU、ROUGE)和无参考指标(如 BERTScore)的局限性,这些指标仍依赖于参考输出或存在与人类判断相关性较低的问题。
  • 开发一种自动化、数据驱动的方法,无需显式建模人类偏好,即可生成并优化高质量、与人类对齐的评分标准。
  • 通过在提示模板中嵌入明确、结构化的评分标准,提升基于大语言模型评估的一致性和可靠性。
  • 通过可扩展的、无需梯度的校准流程,实现评估器在实际部署中具有更高的人类对齐性。

提出的方法

  • 构建一个黄金数据集 $D^*$,包含人工标注的(样本,标签)对,以代表人类偏好。
  • 基于人工标注数据,利用少样本示例的上下文学习,由大语言模型生成初始评分标准集。
  • 在黄金数据集上评估候选标准集,根据与专家标签的相关性筛选并选择表现最佳的标准集。
  • 对表现最佳的标准集应用自-refinement,以提升其清晰度、一致性和与人类判断的对齐性。
  • 将最终校准后的标准集整合到评估提示模板 $\mathcal{T}$ 中,用明确、结构化的评分量规替代通用指令。
  • 采用多阶段流程:草稿 → 评估 → 筛选 → 优化 → 应用,确保无需梯度调优的迭代改进。

实验结果

研究问题

  • RQ1在不进行微调或显式偏好建模的前提下,基于大语言模型的评估器能否被有效校准以更好地对齐人类偏好?
  • RQ2结构化、基于数据生成的评分标准如何提升大语言模型评分与专家人类判断之间的相关性?
  • RQ3有效的 NLG 评估评分标准具有哪些特征?这些标准能否被自动发现并优化?
  • RQ4AutoCalibrate 在摘要生成、数据到文本生成和幻觉检测等多样化 NLG 任务中,能在多大程度上提升性能?
  • RQ5校准后的评估器对提示格式、输入顺序和输出空间的变化具有多强的鲁棒性?

主要发现

  • AutoCalibrate 在多个 NLG 基准测试中显著提升了基于大语言模型的评分与人类专家判断之间的相关性,涵盖 SummEval、SFRES 和 QAGS-CNN 等。
  • 校准后的评估器与专家评分的相关性高于基线大语言模型评估器以及传统基于参考文本的指标(如 BLEU 和 ROUGE)。
  • 自-refinement 过程有效提升了评分标准的质量,减少了模糊性,并增强了评估决策的一致性。
  • 本研究识别出有效评分标准的关键设计原则,如粒度、清晰度和基于事实的具体性,这些特征可增强与人类判断的对齐性。
  • 为每项任务发布的最优标准集为未来的大语言模型评估系统提供了可复用、与人类对齐的基准。
  • 定性分析表明,明确的多维评分标准(如信息量、自然度、事实性)相比通用评分指令,能带来更可靠、更可解释的评估结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。