[论文解读] MDNet: A Semantically and Visually Interpretable Medical Image Diagnosis Network
MDNet 构建了一个统一的多模态网络,用于读取医学影像、生成诊断报告、基于症状描述检索影像,并对可解释诊断可视化注意力。它推动了一个基于多尺度特征的集成连接 ResNet,以及一个带有辅助注意力锐化模块的注意力增强 LSTM。
The inability to interpret the model prediction in semantically and visually meaningful ways is a well-known shortcoming of most existing computer-aided diagnosis methods. In this paper, we propose MDNet to establish a direct multimodal mapping between medical images and diagnostic reports that can read images, generate diagnostic reports, retrieve images by symptom descriptions, and visualize attention, to provide justifications of the network diagnosis process. MDNet includes an image model and a language model. The image model is proposed to enhance multi-scale feature ensembles and utilization efficiency. The language model, integrated with our improved attention mechanism, aims to read and explore discriminative image feature descriptions from reports to learn a direct mapping from sentence words to image pixels. The overall network is trained end-to-end by using our developed optimization strategy. Based on a pathology bladder cancer images and its diagnostic reports (BCIDR) dataset, we conduct sufficient experiments to demonstrate that MDNet outperforms comparative baselines. The proposed image model obtains state-of-the-art performance on two CIFAR datasets as well.
研究动机与目标
- 通过将图像特征与诊断报告对齐来激励可解释的医学图像诊断。
- 开发一个统一模型,能够读取图像、生成报告、基于症状描述检索影像,并可视化注意力。
- 通过新型的集成连接网络提升多尺度图像表示。
- 学习从报告词汇到图像像素的语义映射,为预测提供论证。
- 端到端训练,以辅助监督共同优化图像和语言模型,以提升注意力。
提出的方法
- 引入 EcNet,通过集成连接来整合多尺度特征并提高特征利用率。
- 采用基于 LSTM 的语言模型并使用软注意力将句子词映射到图像区域。
- 加入一个辅助注意力锐化(AAS)模块,以产生更尖锐的、类别特定的注意力图。
- 使用联合训练目标,同时优化诊断结论预测和报告生成,并采用将两者梯度混合回传的反向传播方案。
- 实现一个训练方案,对样本进行复制以创建 K 个特定任务输入给语言模型,以引导有效的梯度流。
- 在统一目标下实现图像模型、语言模型和 AAS 的端到端优化。
实验结果
研究问题
- RQ1一个统一的多模态网络能否在从医学影像生成诊断报告的同时,提供语义上和视觉上可解释的解释?
- RQ2在 BCIDR 数据集上的膀胱癌影像诊断和影像-语言任务中,所提 MDNet 是否优于基线?
- RQ3基于集成连接的网络是否提高了医学影像任务的多尺度特征利用率?
- RQ4注意力锐化是否改善了临床解释中注意力图的定位性和有用性?
主要发现
- 与基线相比,MDNet 在 BCIDR 上实现了更高的诊断结论准确性和报告生成指标。
- MDNet 的句子引导注意力图聚焦于医学信息丰富的尿路上皮区域,提升了可解释性。
- 该模型的 DCA(诊断结论准确性)分数较基线有所提升,并在多折交叉验证中表现稳定。
- EcNet 的集成连接提升了图像表示效率,在 CIFAR-10 和 CIFAR-100 上实现具有竞争力或最先进的结果,参数数量少于某些基线模型。
- 通过有效梯度流实现的联合优化(在图像模型和语言模型梯度之间取得平衡)提升了多模态映射质量,并降低了小型医学数据集上的过拟合。
- MDNet 在基于症状的影像检索中展现出强大的句子到图像映射准确性,在 Cr@k 指标上优于基线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。