[论文解读] Towards a Unified Multi-Dimensional Evaluator for Text Generation
该论文提出UniEval,一种用于文本生成的统一多维评估器,将自然语言生成(NLG)评估建模为布尔型问答(Boolean Question Answering)任务,使单一模型能够评估连贯性、流畅性、一致性和相关性等多个维度。与现有指标相比,UniEval在人类判断上的相关性显著提升——摘要任务中提高23%,对话回复生成任务中提高超过43%;同时在未见过的评估维度和任务上展现出强大的零样本泛化能力。
Multi-dimensional evaluation is the dominant paradigm for human evaluation in Natural Language Generation (NLG), i.e., evaluating the generated text from multiple explainable dimensions, such as coherence and fluency. However, automatic evaluation in NLG is still dominated by similarity-based metrics, and we lack a reliable framework for a more comprehensive evaluation of advanced models. In this paper, we propose a unified multi-dimensional evaluator UniEval for NLG. We re-frame NLG evaluation as a Boolean Question Answering (QA) task, and by guiding the model with different questions, we can use one evaluator to evaluate from multiple dimensions. Furthermore, thanks to the unified Boolean QA format, we are able to introduce an intermediate learning phase that enables UniEval to incorporate external knowledge from multiple related tasks and gain further improvement. Experiments on three typical NLG tasks show that UniEval correlates substantially better with human judgments than existing metrics. Specifically, compared to the top-performing unified evaluators, UniEval achieves a 23% higher correlation on text summarization, and over 43% on dialogue response generation. Also, UniEval demonstrates a strong zero-shot learning ability for unseen evaluation dimensions and tasks. Source code, data and all pre-trained evaluators are available on our GitHub repository (https://github.com/maszhongming/UniEval).
研究动机与目标
- 解决基于相似度的指标在评估文本生成质量方面的局限性。
- 将多维评估统一到单一模型中,以评估连贯性、流畅性、一致性和相关性。
- 通过中间多任务学习引入外部知识,提升评估的鲁棒性。
- 实现对未见过的评估维度和NLG任务的零样本泛化能力。
- 提供一种可扩展、可靠且可解释的框架,用于全面的NLG评估。
提出的方法
- 将文本生成评估重新构架为布尔型问答(QA)任务,其中每个评估维度对应一个特定的“是/否”问题。
- 使用单一的T5-large主干模型生成对多样化QA提示的回答,从而通过一个统一的评估器实现多维评估。
- 引入中间多任务学习阶段,包含四项相关任务:自然语言推理(NLI)、情感分类(SST)、语言学相关任务以及通用问答,以注入外部知识。
- 通过释义和跨度删除构建合成数据,模拟每个维度的负样本。
- 将评估分数与人类判断范围(0–1)对齐,并在人工标注数据上进行微调,以提升相关性。
- 通过仅提示新维度特定的问题而无需进一步微调,实现零样本评估。
实验结果
研究问题
- RQ1一个统一的模型是否能通过单一架构有效评估文本生成质量的多个维度?
- RQ2中间多任务学习阶段在多大程度上提升了评估器的性能与泛化能力?
- RQ3UniEval在零样本设置下,对未见过的评估维度和NLG任务的泛化能力如何?
- RQ4与现有基于相似度的统一指标相比,UniEval在与人类判断的相关性方面表现如何?
- RQ5每一项中间任务对最终评估性能的贡献是什么?
主要发现
- 在摘要任务中,UniEval与人类判断的斯皮尔曼等级相关系数比表现最佳的统一评估器高出23%。
- 在对话回复生成任务中,UniEval的相关性较现有指标提升超过43%。
- UniEval展现出强大的零样本泛化能力,在未见过的评估维度和任务上无需微调即可保持高性能。
- 消融实验证明,NLI对一致性评估贡献最大,而首句预测任务显著提升了连贯性检测能力。
- 将全部四项中间任务(NLI、SST、语言学任务、通用QA)结合,可获得最佳的整体评估性能。
- 在所有任务和维度中,UniEval的得分始终比现有指标(如ROUGE、BERTScore、BARTScore)更接近人类标注结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。