[论文解读] Knowledge-enhanced Visual-Language Pre-training on Chest Radiology Images
本文提出知识增强型自动诊断(KAD),一种用于胸部X光片分析的视觉-语言预训练模型,通过整合知识图谱中的医学知识,提升零样本和少样本诊断性能。通过利用从放射科报告中提取的临床实体与关系,以及基于查询的Transformer(疾病查询网络),KAD实现了与全监督模型相当的零样本性能,并在五种病理中的三种上显著优于三位专家放射科医生的平均水平。
While multi-modal foundation models pre-trained on large-scale data have been successful in natural language understanding and vision recognition, their use in medical domains is still limited due to the fine-grained nature of medical tasks and the high demand for domain knowledge. To address this challenge, we propose a novel approach called Knowledge-enhanced Auto Diagnosis (KAD) which leverages existing medical domain knowledge to guide vision-language pre-training using paired chest X-rays and radiology reports. We evaluate KAD on {four} external X-ray datasets and demonstrate that its zero-shot performance is not only comparable to that of fully-supervised models, but also superior to the average of three expert radiologists for three (out of five) pathologies with statistical significance. Moreover, when few-shot annotation is available, KAD outperforms all existing approaches in fine-tuning settings, demonstrating its potential for application in different clinical scenarios.
研究动机与目标
- 解决现有视觉-语言模型在医学影像中面临的局限,这些模型在细粒度诊断方面表现不佳,且缺乏特定领域的知识。
- 通过从知识图谱中引入结构化医学知识,提升胸部X光片诊断中的零样本和少样本泛化能力。
- 通过生成定位临床相关区域的注意力图,增强模型的可解释性。
- 通过利用图像与报告配对的弱监督预训练,减少对大规模标注数据的依赖。
- 证明知识增强的预训练可实现与人类专家相当或更优的性能,且无需微调即可应用于未见过的病理。
提出的方法
- 采用两阶段训练框架:首先,使用对比学习在医学知识图谱上预训练知识编码器,以学习医学实体和关系的密集文本表示。
- 使用三种方法从放射科报告中提取临床实体和关系:启发式规则、RadGraph或GPT-3.5(ChatGPT),以生成结构化知识输入。
- 在胸部X光片特征与提取的医学实体和关系嵌入之间进行图像-文本对比学习,对齐视觉与知识增强的文本表示。
- 训练一种疾病查询网络(DQN),即一种基于查询的Transformer,以疾病名称作为输入,关注视觉特征以生成分类概率和注意力图。
- 在零样本推理中使用预训练的知识编码器和DQN,将疾病名称编码为查询,并生成突出显示相关图像区域的注意力图。
- 在有额外标注数据时,支持少样本微调,展示出优异的迁移能力。
实验结果
研究问题
- RQ1与现有自监督和监督模型相比,知识增强的视觉-语言预训练是否能提升胸部X光片的零样本诊断性能?
- RQ2在视觉-语言预训练中整合医学知识图谱是否能提升对罕见或未见病理的泛化能力?
- RQ3模型的预测是否可通过与放射科医生标注对齐的注意力图实现可解释性?
- RQ4在多种病理的零样本评估中,模型性能与专家放射科医生相比如何?
- RQ5知识注入在少样本微调场景中在多大程度上提升了数据效率?
主要发现
- 在PadChest数据集上,KAD在193种病理的零样本性能显著优于最先进的自监督模型,且具有统计显著性。
- 在CheXpert数据集上,KAD在零样本评估中,有三种病理的性能显著优于三位专家放射科医生的平均值。
- 在少样本微调中,KAD超越了所有现有方法,展现出卓越的迁移能力和数据效率。
- 模型生成的注意力图与放射科医生的病灶标注高度一致,经ChestX-Det10上的点位游戏评估验证。
- KAD通过交叉注意力图提供可靠且基于事实的视觉解释,增强了临床信任和可解释性。
- 知识图谱表示的整合提升了模型的泛化能力,尤其在长尾和罕见病理上表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。