[论文解读] Local Contrastive Learning for Medical Image Recognition
本文提出局部区域对比学习(LRCLR),一种灵活的微调框架,通过自注意力机制选择显著图像区域,并在这些区域与放射科报告之间应用局部对比学习,从而提升医学图像识别的可解释性与性能。LRCLR在胸部X光片的零样本分类中表现更优,同时突出显示临床相关区域,在识别肺部浸润等细微病理方面优于基线模型。
The proliferation of Deep Learning (DL)-based methods for radiographic image analysis has created a great demand for expert-labeled radiology data. Recent self-supervised frameworks have alleviated the need for expert labeling by obtaining supervision from associated radiology reports. These frameworks, however, struggle to distinguish the subtle differences between different pathologies in medical images. Additionally, many of them do not provide interpretation between image regions and text, making it difficult for radiologists to assess model predictions. In this work, we propose Local Region Contrastive Learning (LRCLR), a flexible fine-tuning framework that adds layers for significant image region selection as well as cross-modality interaction. Our results on an external validation set of chest x-rays suggest that LRCLR identifies significant local image regions and provides meaningful interpretation against radiology text while improving zero-shot performance on several chest x-ray medical findings.
研究动机与目标
- 解决在医学图像中区分细微病理的挑战,因为全局表征可能忽略关键的局部特征。
- 通过将特定图像区域与放射科报告文本关联,提升模型可解释性,增强放射科医生的信任与协作。
- 开发一种模块化、灵活的微调框架,兼容现有对比视觉-语言模型,实现在不修改网络架构的前提下进行局部对比学习。
- 通过聚焦与文本报告对齐的判别性局部图像区域,提升对未见医学发现的零样本性能。
提出的方法
- LRCLR引入一个区域选择模块,利用视觉Transformer编码器生成的自注意力图识别显著图像区域,过滤掉无信息量的背景区域。
- 选定的图像区域通过跨模态Transformer处理,该模块利用自注意力机制学习图像区域与文本标记之间的上下文交互。
- 在跨模态Transformer的类别标记与对应文本嵌入之间应用局部对比损失,使局部图像特征与相关文本描述对齐。
- 该框架设计为即插即用模块,可在微调阶段与任意预训练对比视觉-语言模型集成。
- 该方法不仅利用注意力分数实现跨模态对齐,还用于可解释性,可视化哪些图像区域对给定文本提示最为相关。
- 该方法结合全局对比学习与局部对比学习,同时提升性能与特征层面的可解释性。

实验结果
研究问题
- RQ1自注意力图是否可在无额外监督的情况下有效识别临床相关的局部图像区域?
- RQ2在图像区域与文本之间引入局部对比学习,是否能提升胸部X光片的零样本分类性能?
- RQ3所提出的框架是否能通过突出显示与放射科报告内容有意义对应的图像区域,提升可解释性?
- RQ4LRCLR在识别肺部浸润等细微病理方面,与现有对比框架相比表现如何?
- RQ5LRCLR的模块化设计在多大程度上兼容多种预训练视觉-语言架构?
主要发现
- LRCLR在CheXpert测试集上实现了更优的零样本分类性能,尤其在肺部浸润这一发现上优于基线模型。
- 注意力可视化显示,LRCLR聚焦于临床相关区域,如肺下叶,这些区域存在提示并发症的白色物质。
- 与基线方法突出边缘区域或背景区域不同,LRCLR的区域选择优先关注肺野中不确定或异常的区域。
- 该方法通过生成将特定图像区域与文本提示关联的注意力分数,增强了可解释性,提升了放射科医生与计算机协作的潜力。
- 尽管在噪声较大或存在多病灶的图像中偶尔出现对齐偏差,但通过注意力分数过滤区域,仍提高了突出区域的相关性。
- 该框架兼容多种预训练对比模型,支持模块化部署,无需重新训练基础架构。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。