[论文解读] An Evaluation Protocol for Generative Conversational Systems
本文提出了一种基于 ChatEval 平台的标准化评估协议,通过一对一 A/B 成对比较对生成式对话系统进行评估。该协议在五个数据集上对十种最先进模型进行了人工标注评估,采用 Bradley-Terry 和 TrueSkill 排名方法,结果显示 DialoGPT 和 Blender 表现优于其他模型,证明了该协议的可行性与可复现性,并提供了公开可用的代码和数据。
There is a multitude of novel generative models for open-domain conversational systems; however, there is no systematic evaluation of different systems. Systematic comparisons require consistency in experimental design, evaluation sets, conversational systems and their outputs, and statistical analysis. We lay out a protocol for the evaluation of conversational models using head-to-head pairwise comparison. We analyze ten recent models that claim state-of-the-art performance using a paired head-to-head performance (win-loss-tie) on five evaluation datasets. Our findings show that DialoGPT and Blender are superior systems using Bradley-Terry model and TrueSkill ranking methods. These findings demonstrate the feasibility of our protocol to evaluate conversational agents and evaluation sets. Finally, we make all code and evaluations publicly available for researchers to compare their model to other state-of-the-art dialog models.
研究动机与目标
- 为解决生成式对话系统中因实验设计、评估集和统计方法不一致而导致的系统性、一致性评估缺失问题。
- 建立一种可复现的评估协议,通过使用相同的数据集、设置和统计分析方法,确保模型之间评估的公平性与可比性。
- 通过在 Amazon Mechanical Turk 上使用人工标注者进行 A/B 配对测试,实现对最先进模型的直接、一对一比较。
- 提供公开可用的代码库和评估框架,以支持未来对新型对话模型的基准测试。
提出的方法
- 利用 ChatEval 的 A/B 配对测试框架,在相同的对话上下文下,通过 Amazon Mechanical Turk 上的人工标注者比较两个模型的回复。
- 采用标准化的实验设计,使用一致的评估数据集,包括来自 DBDC、Twitter、Cornell Movie 和 ESL 数据集的单轮和多轮对话。
- 计算每对模型的胜/负/平局得分,并计算主要得分和独特得分,以评估相对性能。
- 应用统计排名模型——Bradley-Terry 和 TrueSkill——从成对比较中生成系统级排名。
- 使用配对 t 检验的 p 值评估模型之间性能差异的统计显著性。
- 所有评估数据、代码和结果均公开发布,以确保可复现性并支持未来基准测试。
实验结果
研究问题
- RQ1标准化的、一对一成对评估协议是否能提升生成式对话模型比较的一致性与公平性?
- RQ2在多样化的对话数据集上,DialoGPT 和 Blender 等最先进模型之间的相对排名如何?
- RQ3不同评估指标(如胜/负/平局、主要得分、独特得分)和统计模型(Bradley-Terry、TrueSkill)在多大程度上产生一致的系统排名?
- RQ4该评估协议在大规模人工评估多个模型时是否具备可扩展性和成本效益?
- RQ5尽管人工评估存在主观性,该协议是否仍能检测出模型之间的有意义性能差异?
主要发现
- DialoGPT 和 Blender(2.7B) 在所有评估数据集上均取得了最高的胜率,其中 DialoGPT 平均赢得 46% 的比较,Blender 胜率为 47%。
- 在 DBDC 数据集上,Blender(2.7B) 对 DialoGPT 的胜率为 41%,而 DialoGPT 胜率为 32%,平局率为 36%,表明其性能表现高度一致。
- Bradley-Terry 模型和 TrueSkill 排名方法均将 DialoGPT 和 Blender 排名前两位,证实了排名结果的稳健性。
- 该协议展现出统计效能,关键比较的 p 值低于 0.05,例如在 Twitter 数据集上 DialoGPT 与 ConvAI2(seq2seq) 的比较(p=0.0),以及在 ESL 数据集上 ConvAI2(KV-MemNN) 与 ParlAI(Controllable) 的比较(p=0.01)。
- 在 ESL 三轮对话数据集上的人工评估显示,人类回复在 58%–66% 的比较中更受青睐,凸显了人类与模型性能之间的差距。
- 所有众包实验的总成本约为 1,300 美元,表明大规模成对评估在实际中是可行且具有成本效益的。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。