[论文解读] Prior Knowledge Enhances Radiology Report Generation
该论文提出了一种知识图谱增强的深度学习框架,用于放射科报告生成,通过将文本挖掘的医学概念关联整合到图卷积网络中,以提升报告质量。通过融合来自RadLex的先验知识和辅助挖掘的文本发现,该模型在IU X-ray数据集上实现了最先进性能,ROUGE-L得分为0.384 ± 0.007,CIDEr得分为0.340 ± 0.011,关键指标优于先前方法1.5–2.0%。
Radiology report generation aims to produce computer-aided diagnoses to alleviate the workload of radiologists and has drawn increasing attention recently. However, previous deep learning methods tend to neglect the mutual influences between medical findings, which can be the bottleneck that limits the quality of generated reports. In this work, we propose to mine and represent the associations among medical findings in an informative knowledge graph and incorporate this prior knowledge with radiology report generation to help improve the quality of generated reports. Experiment results demonstrate the superior performance of our proposed method on the IU X-ray dataset with a ROUGE-L of 0.384±0.007 and CIDEr of 0.340±0.011. Compared with previous works, our model achieves an average of 1.6% improvement (2.0% and 1.5% improvements in CIDEr and ROUGE-L, respectively). The experiments suggest that prior knowledge can bring performance gains to accurate radiology report generation. We will make the code publicly available at https://github.com/bionlplab/report_generation_amia2022.
研究动机与目标
- 为解决现有深度学习模型在放射科报告生成中无法建模医学发现之间相互影响的局限性。
- 通过整合捕捉放射学发现之间关系的先验医学知识,提升报告质量。
- 开发一种数据驱动、可扩展的替代方案,用于放射科报告生成中的手动构建知识图谱。
- 评估先验知识对疾病分类和报告生成性能的影响。
提出的方法
- 该方法从RadLex本体构建知识图谱,其中医学发现为节点,其关联为边,并额外引入从报告中文本挖掘发现的辅助节点。
- 使用图卷积网络(GCN)基于图结构传播并优化节点表示,通过注意力机制融合图像特征。
- 图像特征通过在CheXpert上预训练的DenseNet-121主干网络提取,随后与GCN学习的节点特征融合,用于下游任务。
- 该模型采用双分支架构:一个用于多标签疾病分类,另一个用于使用两级解码器的分层报告生成。
- 该框架采用两步训练流程:首先,通过在前20个疾病节点上使用交叉熵损失优化多标签分类;其次,通过结合交叉熵和强化学习训练报告生成。
- 辅助节点(10个)包含在图中,但被排除在分类损失之外,以丰富特征表示而不引起过拟合。
实验结果
研究问题
- RQ1与缺乏先验知识的模型相比,集成数据驱动的、文本挖掘的知识图谱是否能提升放射科报告生成的质量?
- RQ2作为知识图谱建模的医学发现之间的关联,如何影响生成报告的一致性和准确性?
- RQ3在统一框架中,先验知识在多大程度上提升了疾病分类和报告生成的性能?
- RQ4包含辅助的、文本挖掘的发现是否能提升模型捕捉细微放射学观察的能力?
主要发现
- 所提模型在IU X-ray数据集上实现了ROUGE-L得分为0.384 ± 0.007,CIDEr得分为0.340 ± 0.011,相比先前最先进方法提升1.5–2.0%。
- 该模型在ROUGE-L和CIDEr上均优于Zhang等人[13],分别提升2.0%和1.5%,证明了文本挖掘知识的有效性。
- 消融实验确认,知识图谱和辅助节点均对报告生成性能的提升有显著贡献。
- 该模型在大多数疾病上的AUC性能与Zhang等人[13]相当,表明知识整合未损害分类准确性。
- 错误分析显示,该模型有时会遗漏罕见发现(如钙化结节病中的钙化结节),表明其在捕捉低频模式方面存在局限。
- 通过高斯噪声降低图像质量后,AUC从0.786降至0.683,报告生成指标下降,表明模型对输入质量敏感。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。