[论文解读] Evaluating Open-QA Evaluation
本文提出了 QA-Eval 任务与 EVOUNA 数据集,用于评估开放问题问答(Open-QA)中自动评估指标的可靠性。通过将自动评估器(词法匹配、BERT-Score、BELURT 和 GPT-3.5)与人工标注的黄金标准进行对比,研究发现,目前没有任何一种方法能完全匹配人类判断,尤其是基于大语言模型(LLM)的评估器在长篇、信息丰富的答案上表现尤为薄弱。本研究为提升大语言模型事实性评估的自动评估方法提供了基准。
This study focuses on the evaluation of the Open Question Answering (Open-QA) task, which can directly estimate the factuality of large language models (LLMs). Current automatic evaluation methods have shown limitations, indicating that human evaluation still remains the most reliable approach. We introduce a new task, Evaluating QA Evaluation (QA-Eval) and the corresponding dataset EVOUNA, designed to assess the accuracy of AI-generated answers in relation to standard answers within Open-QA. Our evaluation of these methods utilizes human-annotated results to measure their performance. Specifically, the work investigates methods that show high correlation with human evaluations, deeming them more reliable. We also discuss the pitfalls of current methods and methods to improve LLM-based evaluators. We believe this new QA-Eval task and corresponding dataset EVOUNA will facilitate the development of more effective automatic evaluation tools and prove valuable for future research in this area. All resources are available at \url{https://github.com/wangcunxiang/QA-Eval} and it is under the Apache-2.0 License.
研究动机与目标
- 为解决精确匹配(EM)在开放问题问答评估中的局限性,即无法体现答案之间的语义等价性。
- 提出新的基准任务——评估问答评估(QA-Eval),以衡量自动评估指标与人类判断的相关性。
- 构建 EVOUNA 数据集,这是一个人工标注的资源,用于评估自动评估器在开放问题问答输出上的表现。
- 识别现有自动评估方法(包括词法匹配、神经网络指标和基于大语言模型的评估器)的优势与劣势。
- 为未来开发更可靠、更具事实感知能力的大型语言模型在开放问题问答中的评估工具提供指导。
提出的方法
- 提出 QA-Eval 任务,评估自动评估指标在多大程度上能根据人工标注的正确性对模型输出进行排序。
- 通过在 Natural Questions 和 TriviaQA 数据集上收集五个开放问题问答模型输出的人工标注正确性判断,构建 EVOUNA 数据集。
- 在 EVOUNA 数据集上应用多种自动评估指标——词法匹配、BERT-Score、BELURT 和 GPT-3.5,以衡量其与人工判断的相关性。
- 使用斯皮尔曼等级相关系数和宏平均 F1 值,对每种评估器的表现与人工标注排序进行定量比较。
- 手动对评估器输出中的错误类型进行分类,以识别系统性偏差,例如对改写或扩展答案的过度严格接受标准。
- 将所有资源(包括 EVOUNA 和评估代码)以 Apache-2.0 许可发布,以支持可复现性和社区使用。

实验结果
研究问题
- RQ1现有自动评估指标在开放问题问答中与人类判断的相关性如何?
- RQ2基于大语言模型的评估器(如 GPT-3.5)能否可靠地评估开放问题问答响应的事实正确性,与人类相比?
- RQ3自动评估器的主要错误模式是什么?这些模式在不同指标和答案类型之间有何差异?
- RQ4自动评估器在不同开放问题问答模型和数据集(如 Natural Questions 与 TriviaQA)上的表现有何差异?
- RQ5当前指标在多大程度上未能捕捉语义等价性,尤其是在改写或信息丰富的答案中?
主要发现
- 精确匹配(EM)将模型性能低估最多达 9.7 个百分点,例如在 Natural Questions 上,DPR+FiD 在 EM 上得分为 59.2,但在人工评估中得分为 68.9。
- 没有任何一种自动评估器能完全复制人类排序:GPT-3.5 在 NQ 上的最大斯皮尔曼相关系数为 0.82,在 TQ 上为 0.88,仍显著低于人类之间的判断一致性。
- 基于大语言模型的评估器(如 GPT-3.5)在长篇、详细答案上的表现尤其差,其宏平均 F1 值在 Chat-Llama2 输出上降至 43.0,而人类标注黄金标准的 F1 值为 97.4。
- 在与人类判断的相关性方面,词法匹配优于神经网络指标(如 BERT-Score 和 BELURT),尤其是在短答案上表现更优。
- 错误分析显示,评估器常因过度严格而拒绝有效的改写或扩展答案,其中词法匹配的错误率最高(10.3%),但其与人类排序的一致性最强。
- EVOUNA 数据集揭示,即使表现最佳的自动评估器(GPT-3.5)在 BingChat 输出上的错误率也高达 30.5%,超过人类错误率的六倍,凸显了其在可靠性上的显著差距。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。