[论文解读] MoverScore: Text Generation Evaluating with Contextualized Embeddings and Earth Mover Distance
该论文提出 MoverScore,一种新颖的文本生成评估指标,结合上下文嵌入(如 BERT)与地球移位距离(Earth Mover’s Distance),用于衡量生成文本与参考文本之间的语义相似度。该指标在摘要生成、机器翻译、图像字幕生成和数据到文本生成等多个任务中,与人类判断的相关性达到当前最先进水平,优于强基线模型,甚至在机器翻译任务中平均比监督型指标高出 5.8 分。
A robust evaluation metric has a profound impact on the development of text generation systems. A desirable metric compares system output against references based on their semantics rather than surface forms. In this paper we investigate strategies to encode system and reference texts to devise a metric that shows a high correlation with human judgment of text quality. We validate our new metric, namely MoverScore, on a number of text generation tasks including summarization, machine translation, image captioning, and data-to-text generation, where the outputs are produced by a variety of neural and non-neural systems. Our findings suggest that metrics combining contextualized representations with a distance measure perform the best. Such metrics also demonstrate strong generalization capability across tasks. For ease-of-use we make our metrics available as web service.
研究动机与目标
- 开发一种与人类对文本质量判断高度相关的稳健、无监督文本生成评估指标。
- 克服 BLEU 和 ROUGE 等基于 n-gram 的指标的局限性,这些指标无法捕捉不同表面形式之间的语义相似性。
- 探究将上下文嵌入与地球移位距离结合是否能生成更全面且可泛化的评估指标。
- 在多种文本生成任务(包括摘要生成、机器翻译、图像字幕生成和数据到文本生成)中评估该指标。
- 证明该指标在任务和语言对之间具有良好的泛化能力,甚至在某些情况下超越部分监督型指标。
提出的方法
- 该方法使用上下文嵌入(如 BERT)表示系统输出和参考文本中的词语,以捕捉丰富的语义和句法信息。
- 应用地球移位距离(WMD)计算将系统文本的词分布转换为参考文本分布所需的最小代价,从而建模语义对齐。
- 该指标实现为两种变体:句子级对齐(sentence mover)和词级对齐(word mover),其中后者表现更优。
- 在大规模自然语言推理(NLI)数据集(如 MNLI)上微调 BERT,可提升上下文嵌入的质量,并增强与人类判断的相关性。
- 该方法采用逐层整合技术(如 p-means 和路由机制),有效融合来自 BERT 多层的嵌入表示。
- 最终得分通过系统文本与参考文本加权词嵌入之间的 WMD 距离计算得出,得分越高表示语义匹配越好。
实验结果
研究问题
- RQ1基于上下文嵌入与地球移位距离的指标是否能比现有的基于 n-gram 或嵌入的指标获得更高的与人类判断的相关性?
- RQ2不同嵌入模型(如 BERT 与 ELMo 或 word2vec)的选择如何影响评估指标在不同文本生成任务中的表现?
- RQ3在 NLI 数据上微调 BERT 是否能提升嵌入质量用于评估,若能,提升幅度如何?
- RQ4该指标在多种语言对(尤其是远距离语言对,如中英翻译)中的表现如何?
- RQ5无监督指标如 MoverScore 是否能与监督型指标媲美甚至超越其评估性能?
主要发现
- 在机器翻译任务中,MoverScore 与人类判断的平均相关性达到 0.743,优于当前最先进(SOTA)的监督型指标 5.8 分。
- 在机器翻译任务中,MoverScore 比 METEOR++ 高出 5.7 分,在图像字幕生成任务中比 SPICE 高出 3.0 分,在对话回复生成任务中比 METEOR 高出 2.2 分。
- 在 7 种语言对上,将 BERT 在 MNLI 数据集上微调后,平均相关性提升 1.8 分,证明了任务特定预训练的益处。
- 上下文嵌入(如 BERT)显著优于非上下文嵌入(如 word2vec、ELMo),基于 BERT 的 MoverScore 表现最强。
- MoverScore 中的软对齐方式相比 BERTScore 中的硬对齐方式表现略优,表明更灵活的词匹配机制有助于提升评估性能。
- 与基于词汇的指标(如 SentBLEU)不同,该指标能清晰区分高质量与低质量的翻译结果,后者在区分高质量输出方面表现不佳。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。