[论文解读] Fine-Grained Image-Text Alignment in Medical Imaging Enables Explainable Cyclic Image-Report Generation
本文提出AdaMatch,一种用于胸部X光(CXR)影像中细粒度图文对齐的新型自适应图像块-词语匹配框架,支持可解释的循环式CXR报告生成。通过引入自适应图像块提取(AdaPatch)以动态定位不同大小和位置的病灶,并利用对比学习将自适应图像块与文本标记对齐,AdaMatch在检索和生成任务中均达到最先进性能,在MIMIC-CXR数据集上的R@1分别为51.47%和51.18%。
To address these issues, we propose a novel Adaptive patch-word Matching (AdaMatch) model to correlate chest X-ray (CXR) image regions with words in medical reports and apply it to CXR-report generation to provide explainability for the generation process. AdaMatch exploits the fine-grained relation between adaptive patches and words to provide explanations of specific image regions with corresponding words. To capture the abnormal regions of varying sizes and positions, we introduce the Adaptive Patch extraction (AdaPatch) module to acquire the adaptive patches for these regions adaptively. In order to provide explicit explainability for CXR-report generation task, we propose an AdaMatch-based bidirectional large language model for Cyclic CXR-report generation (AdaMatch-Cyclic). It employs the AdaMatch to obtain the keywords for CXR images and `keypatches' for medical reports as hints to guide CXR-report generation. Extensive experiments on two publicly available CXR datasets prove the effectiveness of our method and its superior performance to existing methods.
研究动机与目标
- 为解决固定图像块方法在医学影像中无法捕捉可变大小和位置病灶的局限性。
- 通过提供具体、局部化的图文对齐而非通用的注意力热力图,提升视觉-语言模型的可解释性。
- 利用细粒度对齐作为引导机制,实现CXR图像与放射科报告之间的双向、循环生成。
- 开发一种在推理过程中提供显式、实例特定解释的方法,而无需依赖真实报告。
- 通过在公开数据集上的广泛评估,展示在CXR-报告检索与生成任务中的卓越性能。
提出的方法
- 提出自适应图像块提取(AdaPatch),基于注意力图动态生成以病灶区域为中心的图像块,适应病灶的大小与位置。
- 采用基于对比学习的图像块-词语对齐模块(AdaMatch),将自适应图像块特征与放射科报告中的对应文本标记进行匹配。
- 利用双向大语言模型(LLM)框架AdaMatch-Cyclic,通过图像中的关键词和报告中的“关键图像块”作为生成提示,实现循环生成。
- 在推理过程中引入预定义的常见医学实体文本词典,以引导CXR图像中关键词的检测,避免依赖真实报告。
- 采用多阶段视觉编码器,其中AdaPatch模块应用于第2、3、4阶段,以提取分层的自适应特征。
- 应用对比损失,将图像块与文本标记对齐于共享嵌入空间,增强细粒度对齐效果。
实验结果
研究问题
- RQ1与固定网格图像块方法相比,自适应图像块提取是否能更有效地表征医学图像中可变大小和位置的病灶?
- RQ2细粒度图像块-词语对齐是否能提供比基于注意力或梯度的方法更明确、更具体的图文关系解释?
- RQ3所提出的基于AdaMatch的循环生成框架是否在生成质量与检索性能上优于现有方法?
- RQ4与固定图像块基线相比,AdaPatch模块在定位临床相关区域方面的有效性如何?
- RQ5循环生成过程本身是否可作为解释CXR图像与放射科报告之间对齐关系的自然机制?
主要发现
- AdaMatch在MIMIC-CXR数据集上的CXR-报告检索任务中达到最先进性能,R@1分别为51.47%(CXR到报告)和51.18%(报告到CXR),较LIMITR高出超过12个百分点。
- 消融实验表明,AdaPatch在CXR到报告任务中提升检索性能2.70%(R@1),在报告到CXR任务中提升2.46%,证明其有效性。
- 图像编码器的第3阶段产生最佳检索性能(R@1 = 51.47%),表明中间层次特征最适于图像块-词语匹配。
- 可视化结果表明,AdaPatch通过从固定网格动态调整图像块中心,成功定位了相关解剖结构与异常,如起搏器和胸腔积液。
- 基于AdaMatch的循环生成框架生成的报告与图像更具真实感且语义对齐,经检索与生成指标验证,其保真度与对齐性均得到提升。
- 该方法提供显式、实例特定的解释:对于任意文本标记,其对应的图像区域(图像块)均被清晰定位,反之亦然。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。