QUICK REVIEW
[论文解读] Human vs Automatic Metrics: on the Importance of Correlation Design
Anastasia Shimorina|arXiv (Cornell University)|May 29, 2018
Natural Language Processing Techniques参考文献 16被引用 10
一句话总结
本文研究了相关性设计(系统级 vs. 句子级)对自然语言生成(NLG)中自动指标评估的影响。基于WebNLG数据集及在语义充分性、语法正确性和流畅性方面的人工判断,研究发现句子级相关性始终显著但较低(例如,METEOR与语义充分性之间的Spearman等级相关系数ρ = 0.73);而系统级相关性通常不显著,凸显了在NLG中采用句子级评估和改进指标的必要性。
ABSTRACT
This paper discusses two existing approaches to the correlation analysis between automatic evaluation metrics and human scores in the area of natural language generation. Our experiments show that depending on the usage of a system- or sentence-level correlation analysis, correlation results between automatic scores and human judgments are inconsistent.
研究动机与目标
- 调查系统级与句子级相关性分析如何影响NLG中自动指标的评估。
- 在两个层级上比较常见自动指标(BLEU、METEOR、TER)与人工判断的表现。
- 揭示由于相关性设计不同而造成的先前NLG评估实践中的不一致性。
- 倡导采用句子级相关性作为NLG中错误分析和指标开发的更优选择。
提出的方法
- 使用包含九个NLG系统生成的223组输入输出的WebNLG数据集。
- 通过众包方式在三点评分制(语义充分性、语法正确性、流畅性)上收集人工判断(每篇文本三个评分)。
- 在系统级和句子级分别计算自动指标(BLEU-4、METEOR、TER),排除人工参考文本以避免偏差。
- 采用Spearman等级相关系数比较两个层级上的人工判断与自动得分。
- 使用双尾检验进行显著性检验,系统级显著性水平α = 0.05,句子级α = 0.001。
- 从分析中排除人工参考文本,因为其自动得分被人为夸大(例如,BLEU = 1.0,TER = 0.0)。
实验结果
研究问题
- RQ1在NLG中,当将自动指标与人工判断进行评估时,系统级与句子级相关性分析的结果有何不同?
- RQ2尽管句子级结果显著,为何系统级相关性常常无法达到统计显著性?
- RQ3在NLG中,常见自动指标(BLEU、METEOR、TER)在句子级上与人工判断的相关性在多大程度上成立?
- RQ4评估设计的选择(系统级 vs. 句子级)是否显著影响对NLG中指标性能的解读?
- RQ5这些发现对开发新型自动评估指标在NLG中的应用有何启示?
主要发现
- 在系统级,仅有METEOR与语义充分性之间的相关性达到统计显著(p < 0.001),其余大多数系统级相关性均不显著。
- 在句子级,所有人工判断与自动指标之间的相关性均达到统计显著(p < 0.001),其中最高相关性为ρ = 0.73(METEOR与语义充分性之间)。
- 自动指标与人工得分在句子级的相关性整体仍较低,绝对值范围在ρ = 0.43至ρ = 0.59之间,与机器翻译(MT)领域发现一致。
- 自动指标在句子级表现出强烈的内部相关性(ρ ≥ 0.78),表明其自身之间具有高度一致性。
- 系统级与句子级结果之间的差异凸显了评估设计的重要性,因为句子级分析能提供更可靠且更精细的洞察。
- 本研究结论认为,当前自动指标在句子级与人工判断的相关性较差,亟需开发针对细粒度NLG评估的新型指标。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。