[论文解读] Simple LLM Prompting is State-of-the-Art for Robust and Multilingual Dialogue Evaluation
该论文提出了一种新颖的多语言、鲁棒对话评估框架,通过简单提示(prompting)大型语言模型(LLMs),包括ChatGPT,结合自监督子指标(如NSP、MLM、VSP)和集成加权方法。该框架在DSTC11 Track 4的Robust和Multilingual任务中均取得最先进性能,显著优于先前方法,排名第一。
Despite significant research effort in the development of automatic dialogue evaluation metrics, little thought is given to evaluating dialogues other than in English. At the same time, ensuring metrics are invariant to semantically similar responses is also an overlooked topic. In order to achieve the desired properties of robustness and multilinguality for dialogue evaluation metrics, we propose a novel framework that takes advantage of the strengths of current evaluation models with the newly-established paradigm of prompting Large Language Models (LLMs). Empirical results show our framework achieves state of the art results in terms of mean Spearman correlation scores across several benchmarks and ranks first place on both the Robust and Multilingual tasks of the DSTC11 Track 4 "Automatic Evaluation Metrics for Open-Domain Dialogue Systems", proving the evaluation capabilities of prompted LLMs.
研究动机与目标
- 为解决现有自动评估框架中缺乏多语言和释义鲁棒性对话评估指标的问题。
- 探究现代大型语言模型(LLMs)是否可通过简单提示,相较于传统编码器模型,成为更优的评估器。
- 开发一个统一的、无需参考文本的对话评估系统,确保在多种语言和改写响应中与人类评估保持高度相关性。
- 证明基于提示的LLM评估可超越监督、自监督和微调基线模型,在鲁棒性和多语言性方面表现更优。
提出的方法
- 该框架结合了多种子指标——有效句子预测(VSP)、下一句预测(NSP)、掩码语言建模(MLM)、参与度(ENG)和ChatGPT),每种子指标针对对话响应的特定质量维度。
- 每种子指标接收包含上下文、响应和质量维度(如连贯性、相关性)的输入,并基于LLM对语言和功能质量的理解生成得分。
- 子指标得分根据质量维度加权并集成,生成最终的对话评估得分,确保鲁棒性和多语言泛化能力。
- 该方法对ChatGPT采用零样本提示,对基于编码器的子指标采用微调后的自监督目标,实现跨语言和响应变化的兼容性。
- 系统在多样化基准上进行训练和评估,包括DSTC11中的基准,重点关注释义不变性和跨语言迁移能力。
- 最终模型已在github.com/johndmendonca/DialEvalML开源,包含子指标的检查点和代码。

实验结果
研究问题
- RQ1仅通过简单提示(如ChatGPT),LLM是否能在不微调的情况下实现对话评估的SOTA性能?
- RQ2提示后的LLM在多语言和改写对话输入中,与人类评估的相关性在多大程度上保持高水平?
- RQ3基于自监督任务和LLM提示的子指标集成,与传统编码器模型相比,在鲁棒性和多语言性方面表现如何?
- RQ4基于LLM的评估在哪些方面存在失败模式,特别是对内容丰富度和适当性的评分,这些失败模式与RLHF偏见有何关联?
主要发现
- 所提出的框架在多个基准上与人类评估的平均Spearman相关性最高,优于现有自动评估指标。
- 在DSTC11 Track 4的Robust和Multilingual任务中均排名第一,鲁棒性任务在turn级和对话级均为第一,多语言性任务在两个层级也均为第一。
- 仅ChatGPT的性能已超过传统编码器模型,平均与人类评估的相关性高出3个百分点以上。
- 尽管表现优异,ChatGPT在某些情况下系统性地低估了响应质量,特别是在涉及“weed”等话题时,可能由于RLHF驱动的安全偏好所致。
- 该模型常将内容丰富度与相关性混淆,表明需要改进提示设计以更清晰地区分质量维度。
- 该框架表明,一天的提示工程优化效果优于为编码器基线模型进行数月的模型筛选与训练,标志着对话评估范式的重大转变。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。