Skip to main content
QUICK REVIEW

[论文解读] FFCI: A Framework for Interpretable Automatic Evaluation of Summarization

Fajri Koto, Timothy Baldwin|arXiv (Cornell University)|Nov 27, 2020
Topic Modeling被引用 8
一句话总结

本文提出 FFCI,一种用于可解释性自动评估生成式摘要的新框架,整合了四个维度:忠实性、聚焦性、覆盖度和句间连贯性。该研究引入了一个新的标注数据集,并对19个预训练语言模型进行了评估,结果表明基于模型的指标在忠实性方面优于问答方法,且揭示了ROUGE未能捕捉到的模型性能差异。

ABSTRACT

In this paper, we propose FFCI, a framework for fine-grained summarization evaluation that comprises four elements: faithfulness (degree of factual consistency with the source), focus (precision of summary content relative to the reference), coverage (recall of summary content relative to the reference), and inter-sentential coherence (document fluency between adjacent sentences). We construct a novel dataset for focus, coverage, and inter-sentential coherence, and develop automatic methods for evaluating each of the four dimensions of FFCI based on cross-comparison of evaluation metrics and model-based evaluation methods, including question answering (QA) approaches, semantic textual similarity (STS), next-sentence prediction (NSP), and scores derived from 19 pre-trained language models. We then apply the developed metrics in evaluating a broad range of summarization models across two datasets, with some surprising findings.

研究动机与目标

  • 为解决在ROUGE之外缺乏可靠、自动化的生成式摘要评估方法的问题。
  • 开发一种细粒度的评估框架,以捕捉事实一致性、内容精确性、召回率以及话语连贯性。
  • 发布一个新的标注数据集,涵盖聚焦性、覆盖度和句间连贯性,以支持可复现的评估。
  • 在多个维度上对传统指标(如ROUGE、BLEU、METEOR)与基于模型的指标(如BERTScore、FactCC、19个PLM)进行基准测试。
  • 通过在CNN/DailyMail和XSUM上的实证评估,揭示标准指标如ROUGE所忽略的模型性能不一致性。

提出的方法

  • FFCI 沿四个维度评估摘要:忠实性(与原文的事实一致性)、聚焦性(相对于参考摘要的内容精确性)、覆盖度(参考摘要中重要信息的召回率)以及句间连贯性(句子之间的语义流畅性)。
  • 对于忠实性,作者使用19个预训练语言模型的句子级语义相似度得分,而非计算成本较高的问答流水线。
  • 聚焦性和覆盖度通过摘要与参考摘要之间的语义等价性进行衡量,利用预训练模型嵌入在句子级别计算精确率和召回率。
  • 句间连贯性通过修改后的下一句预测(NSP)任务进行评估,模型需判断某一句是否在摘要中紧随另一句。
  • 该框架结合了指标间的交叉比较与基于模型的评估,包括语义文本相似度(STS)、问答(QA)以及FactCC。
  • 构建了一个包含1,000个样本的新标注数据集,用于聚焦性、覆盖度和句间连贯性,以实现可靠的评估。

实验结果

研究问题

  • RQ1不同自动指标在评估忠实性方面的表现如何?预训练语言模型的得分能否替代计算成本较高的问答流水线?
  • RQ2传统指标如ROUGE与人类对聚焦性、覆盖度和连贯性的判断之间的相关性有多大?
  • RQ3哪些预训练语言模型在不同摘要模型上对忠实性、聚焦性和覆盖度的评估得分最为可靠?
  • RQ4下一句预测能否有效适配以评估生成式摘要中的句间连贯性?
  • RQ5在超越ROUGE的多个维度上进行评估时,能揭示出关于模型行为的哪些新见解?

主要发现

  • 在CNNDM-PG任务中,用于忠实性评估的性能最佳预训练语言模型是RoBERTa-large,当使用第10层时,平均得分为0.698。
  • 在聚焦性和覆盖度方面,RoBERTa-base和RoBERTa-large在CNNDM-PG任务中分别取得了最高平均分(0.698和0.707)。
  • 基于NSP的连贯性度量与人类判断具有强相关性,其中Electra-base-discriminator的平均NSP得分为0.305,最高为0.311。
  • 基于模型的指标(如BERTScore和FactCC)在忠实性评估中比基于问答的方法更可靠,尤其在低资源设置下表现更优。
  • 在FFCI上重新评估模型时出现令人惊讶的发现:高ROUGE得分的模型在FFCI的所有维度上并不一定表现良好,表明ROUGE对关键摘要质量的覆盖有限。
  • 研究发现,尽管GPT-2模型在ROUGE上得分较高,但在连贯性和覆盖度方面得分较低,凸显了ROUGE在检测结构和事实性问题上的不足。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。