Skip to main content
QUICK REVIEW

[论文解读] MRScore: Evaluating Radiology Report Generation with LLM-based Reward System

Yunyi Liu, Zhanyu Wang|arXiv (Cornell University)|Apr 27, 2024
Radiomics and Machine Learning in Medical ImagingMedicine被引用 3
一句话总结

该论文提出MRScore,一种基于大语言模型的奖励模型,用于评估放射科报告生成,其与人类判断的对齐性表现更优。通过利用GPT-4在七个临床与语言标准上生成合成的、类人般的评估数据,并微调基于Mistral-7B的奖励模型,MRScore在与放射科医生评分的相关性上显著优于传统指标(如BLEU、BERTScore或RadCliQ)。

ABSTRACT

In recent years, automated radiology report generation has experienced significant growth. This paper introduces MRScore, an automatic evaluation metric tailored for radiology report generation by leveraging Large Language Models (LLMs). Conventional NLG (natural language generation) metrics like BLEU are inadequate for accurately assessing the generated radiology reports, as systematically demonstrated by our observations within this paper. To address this challenge, we collaborated with radiologists to develop a framework that guides LLMs for radiology report evaluation, ensuring alignment with human analysis. Our framework includes two key components: i) utilizing GPT to generate large amounts of training data, i.e., reports with different qualities, and ii) pairing GPT-generated reports as accepted and rejected samples and training LLMs to produce MRScore as the model reward. Our experiments demonstrate MRScore's higher correlation with human judgments and superior performance in model selection compared to traditional metrics. Our code and datasets will be available on GitHub.

研究动机与目标

  • 解决传统自然语言生成(NLG)指标(如BLEU)在放射科报告生成中与人类放射科医生评估对齐性差的问题。
  • 克服人类标注训练数据在报告评估模型中成本高且可扩展性有限的局限。
  • 开发一种框架,将放射科医生的专业知识编码为结构化、可解释的评估系统,用于自动化报告评分。
  • 利用大语言模型生成的合成评估数据训练奖励模型,实现在无需大量人工标注标签的情况下达到类人评分性能。
  • 通过整合临床准确性、语言质量与结构完整性,提升自动化评估的可靠性与可解释性。

提出的方法

  • 基于放射科医生的输入设计一个涵盖临床发现、语言质量、结构与一致性的七项标准评估框架。
  • 使用GPT-4为1,000份参考报告生成3,000对合成报告(通过/拒绝),每对报告均标注了在七项标准上的质量评分。
  • 基于Mistral-7B-instruct主干网络,在成对报告上训练奖励模型,其输出奖励为MRScore。
  • 通过监督学习在合成数据上微调奖励模型,使模型学习预测反映报告质量的标量评分。
  • 使用Kendall’s Tau与Spearman相关系数评估模型性能,与人类放射科医生评分进行对比。
  • 将MRScore性能与基线指标(包括BLEU、ROUGE、METEOR、CIDEr、BERTScore、RadGraph F1与RadCliQ)进行比较。

实验结果

研究问题

  • RQ1GPT-4能否可靠地生成与人类放射科医生判断对齐的合成放射科报告评估?
  • RQ2在合成专家级评估数据上训练的大语言模型奖励模型,是否能实现比传统NLG指标更高的与人类评估的相关性?
  • RQ3在与人类评分的相关性及对语言变异的鲁棒性方面,MRScore与混合指标(如RadCliQ)相比表现如何?
  • RQ4将临床与语言标准整合进多维评估框架,在多大程度上提升了模型选择与报告质量评估的性能?
  • RQ5在低资源场景下,基于合成数据训练的奖励模型能否实现与基于人工标注数据训练模型相当的性能?

主要发现

  • MRScore与人类放射科医生评分的Kendall’s Tau为0.250,Spearman’s rho为0.304,显著优于传统指标如BLEU(p值0.688)和ROUGE(p值0.429)。
  • 在所有测试指标中,MRScore与人类评估的相关性最高,Spearman相关系数达0.304,超过BERTScore(0.200)与RadGraph F1(0.176)。
  • 基于Mistral-7B的奖励模型在所有主干模型中表现最佳,Kendall’s Tau为0.250,p值为0.002,表明具有强统计显著性。
  • MRScore与人类评分存在统计显著相关性(p值=0.002),而传统NLG指标如BLEU与ROUGE则无显著相关性(p > 0.05)。
  • 该框架依赖GPT-4生成合成数据,实现了大规模、低成本的训练,且无需人工标注标签,同时保持了与专家判断的高度对齐。
  • 基于RadCliQ的指标表现出中等相关性(Spearman’s rho = -0.241),但MRScore的正向且更强的相关性表明其与人类评估趋势更一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。