Skip to main content
QUICK REVIEW

[论文解读] Question Answering as an Automatic Evaluation Metric for News Article Summarization

Matan Eyal, Tal Baumel|arXiv (Cornell University)|Jun 2, 2019
Topic Modeling参考文献 32被引用 4
一句话总结

该论文提出了 APES,一种用于新闻文章摘要的外部评估指标,通过使用预训练的问答模型衡量摘要回答关键实体相关问题的能力。该方法相较于 ROUGE 与人工评估指标的相关性更高;以 APES 优化的生成式摘要模型在 APES(46.1 对比 39.8)和 ROUGE 分数上均有提升,表明 APES 能够在 ROUGE 之外有效指导摘要生成。

ABSTRACT

Recent work in the field of automatic summarization and headline generation focuses on maximizing ROUGE scores for various news datasets. We present an alternative, extrinsic, evaluation metric for this task, Answering Performance for Evaluation of Summaries. APES utilizes recent progress in the field of reading-comprehension to quantify the ability of a summary to answer a set of manually created questions regarding central entities in the source article. We first analyze the strength of this metric by comparing it to known manual evaluation metrics. We then present an end-to-end neural abstractive model that maximizes APES, while increasing ROUGE scores to competitive results.

研究动机与目标

  • 为解决单参考摘要数据集中 ROUGE 的局限性,提出一种更稳健的外部评估指标。
  • 评估在关键实体上的问答性能是否与人类对摘要质量的判断相关。
  • 开发一种直接以 APES 为目标进行优化的生成式摘要模型,从而同时提升 APES 和 ROUGE 分数。
  • 验证 APES 是否能捕捉连贯性和语义准确性,而不仅依赖于实体的存在,与 ROUGE 不同。
  • 证明 APES 可在不依赖强化学习或复杂奖励设计的情况下,有效指导摘要训练。

提出的方法

  • APES 通过衡量摘要正确回答人工构建的关于关键实体的问题的比例来评估摘要质量。
  • 问题源自参考摘要,聚焦于核心命名实体,确保与关键内容对齐。
  • 使用预训练的阅读理解模型基于摘要回答问题,性能以正确回答问题的比例衡量。
  • 通过注意力机制增强源文档中关键实体的关注度,训练一个生成式序列到序列模型以最大化 APES。
  • 模型利用注意力机制优先关注关键实体,其中实体重要性由一个可学习模块预测,而非依赖黄金标签。
  • 在 CNN/Daily Mail 数据集上评估该方法,结合自动指标(ROUGE)与人工评估(Pyramid、Responsiveness)。

实验结果

研究问题

  • RQ1APES 与人工评估指标(如 Pyramid 和 Responsiveness)的相关性是否强于 ROUGE?
  • RQ2以 APES 为目标优化的生成式摘要模型能否在提升自身 APES 分数的同时,也取得具有竞争力的 ROUGE 分数?
  • RQ3APES 是否对连贯性和语义结构敏感,还是仅检测命名实体的存在?
  • RQ4与使用黄金实体位置相比,模型预测的显著性分数在引导注意力方面效果如何?
  • RQ5APES 中使用的问答系统是否具备足够性能,以确保该指标在评估中可靠且可行?

主要发现

  • APES 与人工评估指标(尤其是 Pyramid 和 Responsiveness)表现出强相关性,优于 ROUGE。
  • 经 APES 优化的模型在测试集上取得 46.1 的 APES 分数,显著高于基线模型的 39.8。
  • 该模型在 ROUGE-1、ROUGE-2 和 ROUGE-L 上的 F1 分数均提升约 1 分,表明 APES 优化同时增强了内在与外在性能。
  • 问答系统在 CNN 和 Daily Mail 上分别达到 72.4% 和 75.8% 的性能,证实该指标在评估中具备可靠性和可行性。
  • 将黄金摘要内容打乱后,APES 得分仅为 53.8%,表明 APES 能够惩罚不连贯和语义丢失,而 ROUGE 则无法检测此类问题。
  • 使用黄金显著实体位置作为模型输入仅带来微小提升(46.3 对比 46.1),表明模型预测的显著性已足够有效,无需依赖黄金标签。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。