[论文解读] The Challenges of Evaluating LLM Applications: An Analysis of Automated, Human, and LLM-Based Approaches
本文评估了三种方法——自动指标、人工评估和基于大语言模型(LLM)的评估——在评估大语言模型(LLM)驱动聊天机器人时的表现,提出了一种分解式评估框架以提升对响应质量的洞察。结果表明,基于因素的评估揭示了比标准方法更细致的缺陷,尽管人工评估仍是黄金标准,但基于LLM的评估在可靠性方面表现不足,尤其是在同一模型评估自身输出时表现更差。
Chatbots have been an interesting application of natural language generation since its inception. With novel transformer based Generative AI methods, building chatbots have become trivial. Chatbots which are targeted at specific domains for example medicine and psychology are implemented rapidly. This however, should not distract from the need to evaluate the chatbot responses. Especially because the natural language generation community does not entirely agree upon how to effectively evaluate such applications. With this work we discuss the issue further with the increasingly popular LLM based evaluations and how they correlate with human evaluations. Additionally, we introduce a comprehensive factored evaluation mechanism that can be utilized in conjunction with both human and LLM-based evaluations. We present the results of an experimental evaluation conducted using this scheme in one of our chatbot implementations which consumed educational reports, and subsequently compare automated, traditional human evaluation, factored human evaluation, and factored LLM evaluation. Results show that factor based evaluation produces better insights on which aspects need to be improved in LLM applications and further strengthens the argument to use human evaluation in critical spaces where main functionality is not direct retrieval.
研究动机与目标
- 调查在自动化、人工和基于大语言模型的评估方法中,评估大语言模型驱动聊天机器人应用时所面临的挑战与不一致之处。
- 解决在评估标准和指标方面缺乏共识的问题,特别是在教育等特定领域中的应用。
- 提出并验证一种分解式评估机制,将响应质量分解为细粒度维度(如正确性、完整性、清晰度、语气等),以实现更精确的评估。
- 比较自动化指标(如BLEURT)、传统人工评估、分解式人工评估与基于大语言模型的评估在可靠性、一致性和结果相关性方面的表现。
- 揭示当前基于大语言模型的评估者在评估自身输出时的局限性,特别是在关键的非检索类任务中,强调人工评估的重要性。
提出的方法
- 开发了一套分解式评估框架,将响应质量分解为若干独立维度,如正确性、完整性、清晰度、语气和可读性。
- 将该框架应用于一个基于检索增强生成(RAG)的教育类聊天机器人(EdTalk),该模型处理教育报告,使用人工和基于大语言模型的评估者进行评估。
- 组织了两组人工评估:专家(领域专家)和新手(非专业人士),针对布卢姆分类法中的不同问题类型评估响应。
- 使用自动化指标(BLEURT)进行定量比较,评估各类评估方法的一致性与评分者间信度。
- 使用GPT-3.5同时生成响应并对其进行评估,测试大语言模型在自我评估中的可靠性。
- 采用Cohen’s Kappa分析评分者间信度,并报告不同维度和评估者类型下的一致性水平。

实验结果
研究问题
- RQ1自动化指标、人工评估与基于大语言模型的评估在评估大语言模型聊天机器人响应时的相关性如何?
- RQ2分解式人工评估在多大程度上提供了比标准人工评估或自动化评估更具有行动意义的洞察?
- RQ3评估者专业程度(专家与新手)如何影响响应评分与评分者间一致性?
- RQ4当同一模型同时生成并评估其自身输出时,基于大语言模型的评估在多大程度上是可靠的?
- RQ5当前评估方法在捕捉大语言模型应用中细微质量问题方面存在哪些关键局限?
主要发现
- 基于因素的评估揭示了比标准评估方法更详细、更具行动意义的响应质量洞察,尤其在识别正确性与清晰度方面的具体缺陷方面表现突出。
- 仅在清晰度维度上评分者间信度达到中等水平,其余所有维度均较低,表明人工评估者之间存在显著分歧,尤其在新手评估者中更为明显。
- 基于大语言模型的评估表现出高度的自我信心,但与人工评估结果的相关性较差,尤其在模型自我评估时更为明显。
- 自动化指标(如BLEURT)与人工评估趋势相似,但在涉及新手评估者时未能捕捉细微差别,表明其泛化能力有限。
- 专家对响应的评分一贯比新手更严格,凸显了评估者专业程度对评估结果的显著影响。
- 自动化、人工与基于大语言模型的评估方法之间结果的相关性极低,表明单一方法不足以实现可靠的评估。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。