Skip to main content
QUICK REVIEW

[论文解读] A Semantically Motivated Approach to Compute ROUGE Scores

Elaheh ShafieiBavani, Mohammad Ebrahimi|arXiv (Cornell University)|Oct 20, 2017
Topic Modeling参考文献 11被引用 3
一句话总结

本文提出 GRouge,一种语义增强型 ROUGE 指标变体,通过在 WordNet 上使用个性化 PageRank 整合词汇和语义相似性,提升与人类判断的相关性。通过结合 n-gram 匹配与词义级语义相似性,GRouge 在 TAC AESOP 数据集上显著优于标准 ROUGE,尤其在包含改写(paraphrasing)的生成式摘要中表现更优。

ABSTRACT

ROUGE is one of the first and most widely used evaluation metrics for text summarization. However, its assessment merely relies on surface similarities between peer and model summaries. Consequently, ROUGE is unable to fairly evaluate abstractive summaries including lexical variations and paraphrasing. Exploring the effectiveness of lexical resource-based models to address this issue, we adopt a graph-based algorithm into ROUGE to capture the semantic similarities between peer and model summaries. Our semantically motivated approach computes ROUGE scores based on both lexical and semantic similarities. Experiment results over TAC AESOP datasets indicate that exploiting the lexico-semantic similarity of the words used in summaries would significantly help ROUGE correlate better with human judgments.

研究动机与目标

  • 解决 ROUGE 对表面词汇重叠的过度依赖,从而在包含改写(paraphrasing)的生成式摘要中实现更公平的评估。
  • 通过整合词语和短语之间的语义相似性,提升 ROUGE 与人类判断的相关性。
  • 开发一种混合指标,平衡词汇匹配与语义理解,实现更稳健的自动摘要评估。
  • 使 ROUGE 更好地评估涉及词汇变化和改写的摘要,特别是在生成式摘要中。

提出的方法

  • 对 WordNet 3.0 应用个性化 PageRank (PPR),计算摘要中词语的词义级语义相似性分布。
  • 在计算相似性前进行词义消歧,以确保语义匹配的准确性。
  • 使用由缩放因子 β 控制的加权组合,将语义相似性得分与标准 ROUGE n-gram 匹配计数相融合。
  • 采用基于图的方法,在 n-gram 层次上计算参考摘要与模型摘要之间的词汇-语义相似性。
  • 优化缩放因子 β 以平衡词汇与语义贡献,β=0.5 时性能最佳。
  • 应用成对 Williams 显著性检验,验证相对于基线 ROUGE 变体的统计改进。

实验结果

研究问题

  • RQ1将语义相似性整合进 ROUGE 是否能提升其与摘要质量人类判断的相关性?
  • RQ2词汇与语义相似性之间的平衡(由 β 控制)如何影响增强型指标的性能?
  • RQ3所提出的 GRouge 方法是否在评估包含改写的生成式摘要时显著优于标准 ROUGE 变体?
  • RQ4使用词义级语义分析在多大程度上减少了 ROUGE 对词汇重叠的偏倚?
  • RQ5GRouge 是否能有效评估词汇形式不同但语义保持一致的摘要?

主要发现

  • 在 TAC 2010 和 2011 AESOP 数据集上,GRouge 变体在所有三项人类判断指标(Pyramid、Responsiveness、Readability)上均显著优于标准 ROUGE 和 ROUGE-WE。
  • 根据成对 Williams 显著性检验,GRouge 相对于 ROUGE 的所有相关性提升均具有统计显著性(p < 0.05)。
  • 最优缩放因子 β 确认为 0.5,平衡了词汇与语义贡献;当 β 接近 0 或 1 时性能下降。
  • GRouge-2 表现最强,尤其在斯皮尔曼等级相关与肯德尔等级相关中,表明其与人类判断的排序一致性更优。
  • 该方法在处理改写内容(如 'It is raining heavily' 与 'It is pouring')时表现出稳健性,而 ROUGE 无法识别其语义等价性。
  • 结果表明 GRouge 非常适合评估生成式摘要,且在文本简化评估中具有应用潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。