[论文解读] An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4
该论文实证评估了用于LLM评估的微调评审模型,结果显示它们在同域表现出色但任务特定、对方案过拟合,并且在泛化性和公平性方面不及 GPT-4。
Recently, there has been a growing trend of utilizing Large Language Model (LLM) to evaluate the quality of other LLMs. Many studies have fine-tuned judge models based on open-source LLMs for evaluation. While the fine-tuned judge models are claimed to achieve comparable evaluation capability with GPT-4, in this work, we conduct an empirical study of LLM-as-a-Judge. Our findings indicate that although the fine-tuned judge models achieve high performance on in-domain test sets, even surpassing GPT-4, they underperform GPT-4 across several dimensions, including generalizability, fairness and adaptability. We also reveal that the fine-tuned judge model inherently operates as a task-specific classifier, consequently imposing the limitations.
研究动机与目标
- 评估对微调 judge 模型在多数据集和多方案上的评估能力。
- 在准确性、一致性和公平性方面将微调评审与 GPT-4 进行比较。
- 研究生成风格与分类风格的评审是否会影响性能。
- 在跨方案评估下检验微调评审的泛化性和偏见。
提出的方法
- 在来自 GPT-4 或人工注释的数据上微调四个开源评审模型(JudgeLM、PandaLM、Auto-J、Prometheus)。
- 使用相同的数据和提示训练生成风格和分类风格(回归)两种变体。
- 在同域和跨域的测试集上进行评估,包括 JudgeLM-test、PandaLM-test、Auto-J-test、Prometheus-test、MT-bench 和 LLMBar 偏见测试。
- 使用准确率、F1、一致性和 Pearson 指标与 GPT-4 及其他基线进行比较。
- 分析评估者之间以及不同方案之间的相关性,以评估过拟合和泛化性。
实验结果
研究问题
- RQ1微调评审模型在同域评测集上的准确性是否可与 GPT-4 相提并论?
- RQ2微调评审是否本质上是对任务特定的分类器,在跨方案上的泛化性有限?
- RQ3生成风格与分类风格的评审在性能或偏见上是否存在差异?
- RQ4与 GPT-4 相比,微调评审在跨方案和偏见评估数据集上的表现如何?
- RQ5哪些偏见(如对冗长或表面质量的偏好)影响微调评审,它们与 GPT-4 的比较情况如何?
主要发现
- 微调评审在同域测试集上取得高准确性,但受限于方案特定的过拟合。
- 在相同数据上训练时,分类风格评审的表现与生成风格相当。
- 在一个评估方案上训练的评审在应用于不同方案时表现不佳,与之相反,GPT-4 保持稳健。
- 在跨域和多轮 MT-bench 评估中,微调评审显著落后于 GPT-4。
- 微调评审对表面质量(如正式性或冗长性)存在偏见,与 GPT-4 不同。
- 基于 DeBERTa 的评估在偏见测试中显示出比基于 LLM 的评估更好的公平性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。