[论文解读] Toward expanding the scope of radiology report summarization to multiple anatomies and modalities
本文提出了 MIMIC-RRS,一个开源数据集,涵盖12种影像模态-解剖结构组合(包括胸部、头部、脊柱等部位的X射线、CT和MRI),支持多模态和多解剖结构的放射科报告摘要任务。结果表明,像 BART 这类预训练模型在极少架构复杂性的情况下即可实现优异性能,同时引入了 F1-RadGraph——一种经放射科医生验证的事实正确性度量标准,可在多种解剖和影像背景下实现可靠评估。
Radiology report summarization (RRS) is a growing area of research. Given the Findings section of a radiology report, the goal is to generate a summary (called an Impression section) that highlights the key observations and conclusions of the radiology study. However, RRS currently faces essential limitations.First, many prior studies conduct experiments on private datasets, preventing reproduction of results and fair comparisons across different systems and solutions. Second, most prior approaches are evaluated solely on chest X-rays. To address these limitations, we propose a dataset (MIMIC-RRS) involving three new modalities and seven new anatomies based on the MIMIC-III and MIMIC-CXR datasets. We then conduct extensive experiments to evaluate the performance of models both within and across modality-anatomy pairs in MIMIC-RRS. In addition, we evaluate their clinical efficacy via RadGraph, a factual correctness metric.
研究动机与目标
- 为解决当前在多种解剖结构和影像模态下缺乏公开可用、可重现的放射科报告摘要(RRS)数据集的问题。
- 克服以往研究仅聚焦于胸部X光且依赖私有数据集的局限,从而阻碍公平比较与复现。
- 开发并验证一种事实正确性度量指标 F1-RadGraph,用于评估不同解剖和影像背景下生成摘要的临床可靠性。
- 在新构建的多样化基准上对预训练模型进行基准测试,以评估其在不同模态-解剖结构组合间的泛化能力。
- 建立一个基于 BART 的强而简洁的基线模型,表明高性能并不依赖于复杂的模型架构。
提出的方法
- 通过整合 MIMIC-III(79,779 份报告)和 MIMIC-CXR(128,003 份报告)构建 MIMIC-RRS,覆盖 11 种模态-解剖结构组合,包括胸部、头部、颈部、副鼻窦、脊柱、腹部和盆腔的 CT、MRI 和 X 射线。
- 在一位获得认证的放射科医生协助下,识别出在不同模态-解剖结构组合中 'Findings' 的 537 种替代部分标题,以提取相关报告内容。
- 使用预训练的放射科专用 NLP 模型(RadGraph)从真实报告和生成报告的结论部分中提取医学实体与关系,用于事实性评估。
- 提出 F1-RadGraph,该度量标准通过计算预测与标准参考答案之间的命名实体和关系的 F1 分数,经放射科医生验证其正确性。
- 在 12 种模态-解剖结构组合上执行了 400 多次跨模态-解剖结构评估,对包括 BART、RoBERTa 和 BioBART 在内的多种预训练模型进行基准测试。
- 使用标准的 ROUGE 分数和临床 F1-RadGraph 分数对模型进行评估,以同时衡量流畅性与事实准确性。
实验结果
研究问题
- RQ1能否构建一个公开可用的、多模态、多解剖结构的放射科报告摘要数据集,以支持可重现且可比较的研究?
- RQ2像 BART 这类预训练模型在 RRS 中对不同模态-解剖结构组合的泛化能力如何?架构复杂性是否能提升性能?
- RQ3F1-RadGraph 这类事实正确性度量是否能有效应用于多样化的解剖和影像背景中,以评估临床可靠性?
- RQ4使用预训练模型中放射科医生标注的实体与关系数据,是否能提升事实一致性,相比无监督 NLP 工具(如 Stanza)?
- RQ5像 BART 这类简单主干网络是否足以实现优异性能,还是必须依赖复杂模块才能实现高质量摘要?
主要发现
- MIMIC-RRS 是一个公开发布的数据集,包含 207,782 份放射科报告,覆盖 12 种模态-解剖结构组合,包括胸部、头部、脊柱等部位的 CT、MRI 和 X 射线,其覆盖范围超越了以往研究。
- 基于 BART 的模型在 F1-RadGraph 指标上表现最佳,表明仅使用标准预训练模型而无需复杂架构修改,即可实现优异性能。
- F1-RadGraph 分数与 ROUGE 分数表现出高度一致性,验证了其在多样化解剖和影像背景下的事实正确性度量可靠性。
- 该数据集包含 11 个域内(in-domain)和 6 个域外(OOD)模态-解剖结构组合,支持对未见过的组合的泛化能力评估。
- 在 RadGraph 中使用经放射科医生验证的实体与关系标注,相比无监督 NLP 工具(如 Stanza),显著提升了事实一致性评估的准确性。
- 尽管近期模型结构日益复杂,本研究结果表明,简单模型如 BART 也能实现具有竞争力的表现,提示架构创新可能并非性能提升的主要驱动力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。