Skip to main content
QUICK REVIEW

[论文解读] Towards objectively evaluating the quality of generated medical summaries

Francesco Moramarco, Damir Jurić|arXiv (Cornell University)|Apr 9, 2021
Biomedical Text Mining and Ontologies被引用 6
一句话总结

本文提出一种事实计数方法,通过让人类评估者提取并对比医学事实,从原始计数中计算精确率、召回率、F1分数和准确率,以客观评估医学文本摘要。尽管事实粒度存在差异,该方法在衍生指标上仍表现出较高的评估者间一致性,微调后的 BART-Med 在所有指标上得分最高,表明生成摘要具有强事实一致性且幻觉极少。

ABSTRACT

We propose a method for evaluating the quality of generated text by asking evaluators to count facts, and computing precision, recall, f-score, and accuracy from the raw counts. We believe this approach leads to a more objective and easier to reproduce evaluation. We apply this to the task of medical report summarisation, where measuring objective quality and accuracy is of paramount importance.

研究动机与目标

  • 开发一种更客观、可重现的人工评估方法,用于医学文本摘要,以减少质量评估中的主观性。
  • 在重新利用的医学数据集上评估最先进文本摘要模型,重点关注事实准确性和完整性。
  • 评估基于事实计数的指标是否在医学自然语言生成评估中,相比传统李克特量表评估,能获得更高的评估者间一致性。
  • 通过受控的人工评估协议,识别摘要模型(尤其是生成式与抽取式模型)的行为,特别是幻觉现象。

提出的方法

  • 评估者被指导在生成的摘要中统计医学事实,并与参考描述进行对比,使用两个基于示例的指南以标准化事实提取。
  • 使用参考事实(R)、生成事实(G)和正确识别的事实(G&R)的原始计数,计算精确率、召回率、F1分数和准确率。
  • 评估在 Heartex 注释平台上的自定义任务中进行,由三位全科医生作为评估者。
  • 使用克里彭多夫的阿尔法系数测量原始事实计数和衍生指标的评估者间一致性,以验证可靠性。
  • 该方法应用于四种模型:Lead-3(基线)、BERT-Ext(抽取式)、Pegasus-CNN(生成式)和微调后的 BART-Med(生成式)。
  • 对一致性进行分解分析,以研究事实粒度差异及其对衍生指标的影响。

实验结果

研究问题

  • RQ1事实计数方法是否能提升医学文本摘要人工评估的客观性和可重现性?
  • RQ2在原始事实计数与精确率、F1分数等衍生指标之间,评估者间一致性如何变化?
  • RQ3最先进摘要模型(包括生成式模型)在多大程度上避免了医学事实的幻觉?
  • RQ4评估者在事实选择上的粒度水平是否显著影响评估指标的可靠性?

主要发现

  • 在 MTSamples 数据集上微调的 BART-Med 模型在所有评估者中均取得最高 F1 分数(0.72)、精确率(0.77)、召回率(0.70)和准确率(1.0)。
  • 所有四种模型均达到近乎完美的准确率(1.0),表明幻觉极少,即使 Pegasus-CNN 在生成描述中出现了一处数值错误。
  • 尽管原始事实计数的一致性较低(参考事实的克里彭多夫阿尔法 = 0.25),但衍生指标(如 F1 分数)表现出高度一致性(阿尔法 = 0.89),表明对粒度差异具有鲁棒性。
  • 评估者在事实提取粒度上存在差异,其中一名评估者(E3)的粒度低于其他评估者,但所有评估者在衍生指标衡量的整体摘要质量上达成一致。
  • 连贯性一致性较低(阿尔法 = 0.40),原因在于类别不平衡,但 82.5% 的案例被一致评为连贯,表明在大多数情况下存在强烈共识。
  • 事实计数方法即使在事实级标注不一致的情况下,也能实现可靠、客观的评估,适用于可重现的医学自然语言生成评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。