[论文解读] PRIOR: Prototype Representation Joint Learning from Medical Images and Reports
该论文提出PRIOR,一种原型表征学习框架,通过句子级原型记忆库和跨模态条件重建,联合学习医学图像与报告之间的全局和局部对齐。通过原型分类和非自回归生成建模细粒度视觉与语言特征,PRIOR在多个数据集的五个下游任务中实现最先进性能,包括在100%训练数据下的RSNA目标检测任务中达到22.20%的mAP。
Contrastive learning based vision-language joint pre-training has emerged as a successful representation learning strategy. In this paper, we present a prototype representation learning framework incorporating both global and local alignment between medical images and reports. In contrast to standard global multi-modality alignment methods, we employ a local alignment module for fine-grained representation. Furthermore, a cross-modality conditional reconstruction module is designed to interchange information across modalities in the training phase by reconstructing masked images and reports. For reconstructing long reports, a sentence-wise prototype memory bank is constructed, enabling the network to focus on low-level localized visual and high-level clinical linguistic features. Additionally, a non-auto-regressive generation paradigm is proposed for reconstructing non-sequential reports. Experimental results on five downstream tasks, including supervised classification, zero-shot classification, image-to-text retrieval, semantic segmentation, and object detection, show the proposed method outperforms other state-of-the-art methods across multiple datasets and under different dataset size settings. The code is available at https://github.com/QtacierP/PRIOR.
研究动机与目标
- 为解决现有视觉-语言预训练方法在捕捉医学影像中细粒度、位置感知表征方面的局限性。
- 通过利用结构化临床报告语义,改进低层次特征学习(如病灶边界和症状描述)。
- 通过掩码图像和句子原型的条件重建,实现有效的跨模态信息交换。
- 开发一种非自回归、并行解码策略,用于重建非顺序性医学报告。
- 证明基于原型的表征学习在提升下游医学图像分析任务中的有效性。
提出的方法
- 构建句子级原型记忆库,将句子表征离散化为类别原型,实现语义相似临床描述的聚类。
- 设计跨模态条件重建模块,利用报告特征重建掩码图像,反之亦然,最大化模态间的条件互信息。
- 采用非自回归生成范式,通过二分匹配并行重建句子原型,避免顺序自回归生成。
- 通过对比损失强制图像子区域与报告句子之间的局部对齐,采用改进的采样策略以避免空间相邻的负样本。
- 通过注意力池化获取全局表征,同时利用基于原型的聚类优化局部特征。
- 在端到端训练方案中整合全局对齐、局部对齐、跨模态重建和原型记忆库。

实验结果
研究问题
- RQ1基于原型的表征学习能否提升医学报告与图像中细粒度、临床相关特征的建模?
- RQ2跨模态条件重建在提升定位感知任务(如分割和目标检测)的低层次特征学习方面有何作用?
- RQ3非自回归、并行解码策略是否优于自回归生成,用于重建非顺序性医学报告?
- RQ4句子级原型记忆库在提升表征聚类与下游任务泛化能力方面的作用有多大?
- RQ5框架中的各个组件——局部对齐、重建和原型记忆——对整体性能的贡献如何?
主要发现
- 在1% SIIM分类任务中,PRIOR达到87.27%的准确率,优于次佳方法2.42个百分点。
- 在1% SIIM分割任务中,PRIOR达到20.43%的Dice分数,较基线模型提升2.55分,且所有组件均参与。
- 在RSNA目标检测任务中,PRIOR在100%训练数据下实现22.20%的mAP(0.5:0.95),超越此前最先进方法0.55分。
- 消融研究证实,所有组件——局部对齐、跨模态重建和句子原型记忆库——均至关重要,完整模型在关键任务上相较变体最高提升4.5%。
- t-SNE可视化显示,PRIOR生成的表征更具区分性,呈现更清晰的聚类结构,表明语义分离更优。
- 跨模态注意力图显示,模型能正确定位与特定报告句子相对应的图像区域,验证了可解释性与对齐质量。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。