Skip to main content
QUICK REVIEW

[论文解读] Adaptations of ROUGE and BLEU to Better Evaluate Machine Reading Comprehension Task

Yang An, Kai Liu|arXiv (Cornell University)|Jun 10, 2018
Topic Modeling参考文献 15被引用 3
一句话总结

该论文提出了改进版的 ROUGE 和 BLEU 指标,通过引入情感感知和实体感知的奖励项,以提升对机器阅读理解系统(MRC)的评估效果,尤其适用于是/否类问题和实体列表类问题。改进后的指标与人类判断的相关性显著提高——在整体评分上,ROUGE-L 的皮尔逊相关系数最高达到 0.570,表明这些指标在评估具有挑战性的问题类型时,与人类评价的对齐程度得到改善。

ABSTRACT

Current evaluation metrics to question answering based machine reading comprehension (MRC) systems generally focus on the lexical overlap between the candidate and reference answers, such as ROUGE and BLEU. However, bias may appear when these metrics are used for specific question types, especially questions inquiring yes-no opinions and entity lists. In this paper, we make adaptations on the metrics to better correlate n-gram overlap with the human judgment for answers to these two question types. Statistical analysis proves the effectiveness of our approach. Our adaptations may provide positive guidance for the development of real-scene MRC systems.

研究动机与目标

  • 解决标准 ROUGE 和 BLEU 指标在评估机器阅读理解(MRC)系统时的局限性,特别是针对是/否类和实体列表类问题。
  • 指出基于词重叠的指标可能无法捕捉到答案中意见相反或实体缺失/误分类情况下的语义一致性。
  • 开发一个统一的、自动化的评估框架,通过引入对是/否观点和实体正确性的领域特定感知,增强 ROUGE 和 BLEU 指标。
  • 提升自动指标与人类判断之间的一致性,尤其在现实世界 MRC 场景中此类问题类型占主导地位的情况下。
  • 提供一种可扩展的端到端解决方案,在避免人工标注的同时,提升对多样化问题类型的评估可靠性。

提出的方法

  • 引入一个是/否观点奖励项,基于观点词的词重叠,奖励候选答案与参考答案在二元观点(是/否)上的一致性。
  • 引入一个实体奖励项,奖励正确列出的实体,重点提升答案中命名实体的精确率与召回率。
  • 通过将观点和实体奖励项整合到 ROUGE-L 和 BLEU-4 的标准评分公式中,修改其评分机制,使最终得分能反映超越 n-gram 重叠的语义一致性。
  • 采用原始指标得分与奖励项的加权组合,其中超参数 α(用于是/否)和 β(用于实体)分别设置为 2.0 和 1.0。
  • 使用配对自助抽样法测试改进性能相对于基线指标的统计显著性。
  • 在 DuReader 数据集上验证改进指标的有效性,评估层级包括单题评分和整体评分,均使用人工标注的判断结果。

实验结果

研究问题

  • RQ1标准 ROUGE 和 BLEU 指标在 MRC 的是/否类和实体列表类问题上,与人类判断的相关性如何?
  • RQ2引入情感感知和实体感知的奖励项是否能提升自动指标与人类评估之间的一致性?
  • RQ3奖励项权重(α 和 β)如何影响改进指标的性能?
  • RQ4改进版 ROUGE-L 是否在不同问题类型上均优于原始 ROUGE-L 和改进版 BLEU-4?
  • RQ5与原始指标相比,改进指标的性能提升是否具有统计显著性?

主要发现

  • 改进版 ROUGE-L 在整体评分上与人类判断的皮尔逊相关系数(PCC)达到 0.570,显著高于原始 ROUGE-L(0.504)和改进版 BLEU-4(0.481),后者为单题评估结果。
  • 在整体评分评估中,改进版 ROUGE-L 的 PCC 达到 0.792,优于原始 ROUGE-L(0.760)和改进版 BLEU-4(0.646),相较原始指标相对提升 4.2%。
  • 改进版 BLEU-4 在实体类答案上的表现显著提升(PCC 0.686 vs. 0.668),但在是/否类问题上表现劣于原始 BLEU-4,表明 BLEU 的可分解性可能存在潜在问题。
  • 配对自助抽样统计检验确认,改进指标在所有问题类型(是/否、实体、整体)上均显著优于其原始版本(所有 6 项检验的 p < 0.05)。
  • 奖励项权重的影响具有单调性:增加 α(是/否奖励)和 β(实体奖励)会持续提升对应问题类型的 PCC,表明该设计具有可调校性与可扩展性。
  • 结果表明,将语义感知的奖励项融入标准指标,可显著增强其反映人类判断的能力,尤其适用于非事实性、现实世界中的 MRC 问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。