[论文解读] Are Large Language Model-based Evaluators the Solution to Scaling Up Multilingual Evaluation?
本文研究了 GPT-4 是否可作为 LLM 输出的可扩展多语言评估工具,通过在八种语言和三个任务中与 20,000 个真人标注结果进行校准,验证其判断。研究发现,GPT-4 在评分上存在一致的偏高倾向,尤其在低资源语言和非拉丁字母语言中更为明显,凸显了使用真人标注进行校准以确保可靠多语言评估的必要性。
Large Language Models (LLMs) excel in various Natural Language Processing (NLP) tasks, yet their evaluation, particularly in languages beyond the top $20$, remains inadequate due to existing benchmarks and metrics limitations. Employing LLMs as evaluators to rank or score other models' outputs emerges as a viable solution, addressing the constraints tied to human annotators and established benchmarks. In this study, we explore the potential of LLM-based evaluators, specifically GPT-4 in enhancing multilingual evaluation by calibrating them against $20$K human judgments across three text-generation tasks, five metrics, and eight languages. Our analysis reveals a bias in GPT4-based evaluators towards higher scores, underscoring the necessity of calibration with native speaker judgments, especially in low-resource and non-Latin script languages, to ensure accurate evaluation of LLM performance across diverse languages.
研究动机与目标
- 评估类似 GPT-4 的大语言模型是否能有效将多语言评估扩展至英语以外的语言,减少对昂贵人工标注者的依赖。
- 识别并量化基于 LLM 的评估工具中的偏见,特别是针对低资源语言和非拉丁字母语言(如中文、日文和捷克语)。
- 评估不同提示策略在提升多语言和多指标下基于 LLM 的评估一致性方面的有效性。
- 建立一种基于真人判断的 LLM 评估工具校准框架,确保在不同任务、语言和评估维度下实现可靠且可泛化的评估。
- 为未来研究提供最佳实践建议,强调在非英语环境中部署基于 LLM 的评估工具时,必须谨慎对待未经真人标注校准的情况。
提出的方法
- 将 GPT-4 的判断与八种语言中三类文本生成任务(如摘要、翻译、对话)的 20,000 个真人标注得分进行校准。
- 采用多维评估框架,评估多种语言中的语言可接受性、任务完成度、安全性、连贯性和流利度。
- 探索多种提示策略:单指标提示 vs. 多指标提示、 few-shot 示例,以及详细指令集。
- 使用百分比一致率(PA)和相关性度量(如斯皮尔曼等级相关系数)来衡量 LLM 与人工判断之间的一致性,以评估可靠性。
- 评估模型指令清晰度和评估者角色设定对判断一致性的影响,特别是在低资源和词形复杂的语言中。
- 提出一种校准框架,通过参考真人判断对 LLM 输出进行调整,以减少系统性偏见。

实验结果
研究问题
- RQ1GPT-4 是否能在包括低资源语言和非拉丁字母语言在内的多种语言中,作为 LLM 输出的可靠多语言评估工具?
- RQ2基于 LLM 的评估工具(如 GPT-4)在多大程度上表现出对高分的偏见?这种偏见在不同语系和资源水平之间如何变化?
- RQ3不同的提示策略(如单指标 vs. 多指标、few-shot 示例)如何影响基于 LLM 的评估的一致性和准确性?
- RQ4详细指令集和评估者角色设定对减少多语言 LLM 评估中偏见的影响是什么?
- RQ5使用真人标注进行校准在多大程度上能将 LLM 的判断与人类共识对齐,特别是在语言结构复杂或代表性不足的语言中?
主要发现
- 基于 GPT-4 的评估工具始终给出高于真人标注者的评分,尤其在中文、日文等非拉丁字母语言,以及捷克语等低资源语言中更为明显。
- GPT-4 与人工判断之间的百分比一致率(PA)总体较高,但这是由模型对高分的偏见驱动的,而非与人类共识的准确对齐。
- 逐项评估单一指标比在单个提示中同时评估多个指标更可靠,尽管这会增加 LLM 推理调用次数。
- 提供 few-shot 示例或更详细的指令并未显著减少对高分的偏见,表明该问题根植于模型行为本身。
- 在词形丰富、书写系统复杂或训练数据暴露有限的语言中,偏见最为显著,表明 LLM 在处理语言多样性方面存在困难。
- 本研究结论认为,基于 LLM 的评估工具在未经母语者判断校准的情况下不应被部署,尤其是在非英语和低资源环境中。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。