Skip to main content
QUICK REVIEW

[论文解读] Sensitivity of BLANC to human-scored qualities of text summaries

Oleg Vasilyev, Vedant Dharnidharka|arXiv (Cornell University)|Oct 13, 2020
Topic Modeling参考文献 15被引用 6
一句话总结

本文通过测试BLANC在五项人工评分质量维度(流畅性、可理解性、信息量、简洁性和事实正确性)上的敏感度,评估了BLANC这一自动文本摘要质量度量方法。基于300对摘要-文本的人工标注数据,研究发现,当使用最优参数(特别是掩码频率M=2)时,BLANC的皮尔逊相关性水平可与人工标注者相当,但其对事实性错误的敏感度仍较弱,错误数量的相关性为-0.14(Spearman等级相关)。

ABSTRACT

We explore the sensitivity of a document summary quality estimator, BLANC, to human assessment of qualities for the same summaries. In our human evaluations, we distinguish five summary qualities, defined by how fluent, understandable, informative, compact, and factually correct the summary is. We make the case for optimal BLANC parameters, at which the BLANC sensitivity to almost all of summary qualities is about as good as the sensitivity of a human annotator.

研究动机与目标

  • 评估BLANC这一自动摘要质量度量方法在多个摘要质量维度上与人工判断的相关性。
  • 识别能最大化对流畅性、信息量和事实正确性等人工评分质量维度敏感度的BLANC最优参数。
  • 评估基于logits、概率或对数概率的BLANC替代形式是否能提高与人工评分的相关性。
  • 探究BLANC在检测事实性错误方面的局限性,这是自动评估中的关键挑战。
  • 通过人工标注的摘要质量评分,提供一个经验证且可复现的BLANC基准测试。

提出的方法

  • BLANC通过使用预训练的BERT模型,计算在摘要作为上下文时与使用填充字符串作为上下文时,掩码词预测准确率的提升,从而定义该度量。
  • 该度量定义为 $BLANC = (N_{help} - N_{base}) / N_{total}$,其中 $N_{help}$ 表示使用摘要时的正确预测数,$N_{base}$ 表示不使用摘要时的正确预测数,$N_{total}$ 表示被掩码的总词数。
  • 掩码按每M个词进行一次(M=2, 6),并施加词长和分词限制,以避免掩码停用词或不完整的子词。
  • 人工评估使用10名标注者对300对摘要-文本对在五个5分制量表上进行评分:流畅性、可理解性、信息量、简洁性和事实正确性。
  • 测试了使用正确词的logits、概率或对数概率替代二元准确率的BLANC替代变体。
  • 通过在CNN/Daily Mail摘要中进行实体替换,引入合成事实性错误,以测试BLANC对事实正确性的敏感度。

实验结果

研究问题

  • RQ1BLANC对人工评分的摘要质量(如流畅性、信息量和事实正确性)有多敏感?
  • RQ2哪些BLANC参数设置(如掩码频率M)能最大化与人工判断的相关性?
  • RQ3基于模型置信度分数(logits、概率)的BLANC替代形式是否能提高与人工质量评分的相关性?
  • RQ4与人工标注者相比,BLANC在检测摘要中事实性错误方面的表现如何?
  • RQ5BLANC能否在多个维度上实现与人类相当的摘要质量敏感度?

主要发现

  • 使用M=2掩码步长的BLANC在与人工判断的相关性上表现最佳,优于M=6,尤其在整体质量与流畅性方面。
  • BLANC(M=2)与整体人工质量评分的皮尔逊相关性在新闻摘要中达到0.372,在CNN/Daily Mail摘要中为0.222。
  • BLANC对流畅性和整体质量表现出强敏感度,其相关性水平与人工标注者之间的相关性相当。
  • BLANC对事实正确性的敏感度较弱:与人工标注的错误数量相关性为-0.14(Spearman等级相关),表明其检测事实错误的能力有限。
  • 在合成错误实验中,当引入实体替换时,BLANC(M=2)仅在56%的情况下正确降低得分,且在32%的情况下得分反而上升,表明其对事实错误的响应不一致。
  • 使用logits或概率的BLANC替代变体表现略差或相当,其中logits变体表现最佳(CNN/Daily Mail中皮尔逊相关性为0.222),提示未来仍有优化空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。