[论文解读] A Closer Look into Automatic Evaluation Using Large Language Models
本文研究了基于大语言模型(LLM)的自动评估中的设计选择,对比了 LLM Evaluation(Chiang 和 Lee, 2023)与 G-Eval(Liu 等, 2023)。研究发现,强制 LLM 仅输出数值评分会损害其与人类判断的相关性,而要求其提供推理过程(自我解释)则能显著提升对齐程度。该研究在两个元评估数据集上实现了最先进的相关性表现,优于此前使用 GPT-4 的结果。
Using large language models (LLMs) to evaluate text quality has recently gained popularity. Some prior works explore the idea of using LLMs for evaluation, while they differ in some details of the evaluation process. In this paper, we analyze LLM evaluation (Chiang and Lee, 2023) and G-Eval (Liu et al., 2023), and we discuss how those details in the evaluation process change how well the ratings given by LLMs correlate with human ratings. We find that the auto Chain-of-Thought (CoT) used in G-Eval does not always make G-Eval more aligned with human ratings. We also show that forcing the LLM to output only a numeric rating, as in G-Eval, is suboptimal. Last, we reveal that asking the LLM to explain its own ratings consistently improves the correlation between the ChatGPT and human ratings and pushes state-of-the-art (SoTA) correlations on two meta-evaluation datasets.
研究动机与目标
- 识别影响 LLM 基自动评估与人类评分对齐程度的关键设计组件。
- 比较不同提示策略(尤其是自动思维链 CoT 与输出格式)对评估性能的影响。
- 确定强制 LLM 仅输出数值分数是否为实现与人类对齐评估的最优方案。
- 在既定的元评估基准上,提升 LLM 与人类评分之间相关性的最先进水平。
提出的方法
- 在两个元评估数据集(SummEval:摘要生成;Topical-Chat:对话)上开展消融研究。
- 对比两种提示策略:LLM Evaluation(自由格式评分问题)与 G-Eval(仅输出数值的提示)。
- 评估自动思维链(CoT)生成在评估步骤中的影响,对比人工编写的与 LLM 生成的评估标准。
- 使用皮尔逊相关系数与肯德尔等级相关系数(Kendall’s tau)衡量 LLM 评分与人类标注的一致性。
- 测试多种输出格式:'仅评分'、'评分-解释' 与 '分析-评分',以评估推理过程的影响。
- 使用 GPT-3.5-turbo 与 GPT-4 进行推理,对每个样本平均生成 20 个评分以减少方差。
实验结果
研究问题
- RQ1与人工编写的评估步骤相比,自动思维链(CoT)生成是否能提升 LLM 评分与人类评分之间的相关性?
- RQ2是否限制 LLM 输出仅为数值分数,是实现与人类对齐评估的最优方案?
- RQ3要求 LLM 解释其推理过程(即进行推理说明)是否能提升其与人类判断的相关性?
- RQ4所提出的提示策略是否能在 SummEval 与 Topical-Chat 等元评估基准上实现最先进相关性?
- RQ5不同输出格式(如 '评分-解释' 与 '仅评分')如何影响基于 LLM 评估的可靠性与与人类的对齐程度?
主要发现
- 自动思维链(CoT)生成并未在所有情况下均提升与人类评分的相关性;在某些情况下甚至降低了对齐程度。
- 强制 LLM 仅输出数值评分并非最优方案,反而导致与人类判断的相关性降低。
- 要求 LLM 通过自我解释来说明其评分理由,能显著提升与人类评分的相关性。
- 所提出的方法在 SummEval 与 Topical-Chat 上均实现了最先进相关性,部分结果超越了此前使用 GPT-4 所达到的 SOTA 水平。
- '评分-解释' 输出格式在与人类标注的相关性方面,始终优于 '仅评分' 与 '分析-评分' 格式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。