[论文解读] TandemNet: Distilling Knowledge from Medical Images Using Diagnostic Reports as Optional Semantic References
TandemNet 是一种多模态深度学习框架,通过双注意力机制将诊断报告与医学影像相结合,以提升疾病分类性能并提供可解释的预测结果。它通过联合学习视觉与语义特征,在 BCIDR 数据集上实现了最先进性能,支持仅使用图像进行准确推理,并生成注意力图与报告。
In this paper, we introduce the semantic knowledge of medical images from their diagnostic reports to provide an inspirational network training and an interpretable prediction mechanism with our proposed novel multimodal neural network, namely TandemNet. Inside TandemNet, a language model is used to represent report text, which cooperates with the image model in a tandem scheme. We propose a novel dual-attention model that facilitates high-level interactions between visual and semantic information and effectively distills useful features for prediction. In the testing stage, TandemNet can make accurate image prediction with an optional report text input. It also interprets its prediction by producing attention on the image and text informative feature pieces, and further generating diagnostic report paragraphs. Based on a pathological bladder cancer images and their diagnostic reports (BCIDR) dataset, sufficient experiments demonstrate that our method effectively learns and integrates knowledge from multimodalities and obtains significantly improved performance than comparing baselines.
研究动机与目标
- 通过在训练过程中引入诊断报告作为语义参考,提升医学图像分类的可解释性与准确性。
- 开发一种多模态神经网络,联合学习图像与报告,支持以图像为主导和图文协同驱动的推理。
- 通过视觉与文本注意力图提供可解释的预测,突出显示相关图像区域与报告段落。
- 通过微调语言建模实现从图像端到端生成诊断报告,提升临床可用性。
- 通过在推理时有无文本输入的测试,验证模型的鲁棒性与泛化能力。
提出的方法
- 使用宽残差网络(WRN)作为图像编码器,提取大小为 $14 \times 14 \times C$ 的特征图作为视觉表征 $\bm{V}$。
- 采用基于 LSTM 的语言模型将诊断报告编码为矩阵 $\bm{S} \in \mathbb{R}^{D \times N}$,其中每一列表示一个特征描述。
- 引入双注意力机制,计算视觉特征 $\bm{V}$ 与语义特征 $\bm{S}$ 之间的跨模态注意力,生成上下文向量 $\bm{c}$。
- 在视觉特征图上应用可学习的注意力图 $\bm{\alpha}$,以突出显示显著图像区域,其条件基于图像与文本特征。
- 在上下文向量 $\bm{c}$ 上添加多层感知机(MLP)头用于最终分类,并通过残差连接保留视觉特征完整性。
- 使用反向传播通过时间(BPTT)对整个网络进行微调,以从视觉特征生成诊断报告,初始训练期间冻结 CNN 与双注意力模块。
实验结果
研究问题
- RQ1诊断报告能否作为可选的语义参考,有效提升医学图像分类的准确率与可解释性?
- RQ2双注意力机制在多模态网络中如何增强视觉与文本模态之间的特征蒸馏?
- RQ3在仅提供图像的情况下,经过图像与报告联合训练的模型在推理时能保持多高的性能?
- RQ4模型能否仅从图像生成具有临床相关性的诊断报告描述?其生成结果与专家标注报告相比如何?
- RQ5哪些图像与文本特征最能预测特定疾病标签?注意力图是否能反映病理科医生的临床推理过程?
主要发现
- 在 BCIDR 数据集上,TandemNet 相较基线模型显著提升了分类准确率,当无文本输入时,较 ResNet16-4 提升 4% 性能。
- 即使在无文本输入时,模型仍保持强大的视觉注意力性能,表明双注意力机制可独立保留视觉特征的实用性。
- 文本注意力图具有高度选择性,聚焦于细胞密集与核异型等临床相关特征,这些特征与高分级疾病标签强相关。
- t-SNE 可视化显示,训练时使用文本输入可使 MLP 的输入特征聚类更紧密,表明特征表征学习得到改善。
- TandemNet 生成的诊断报告与病理科医生标注的报告高度一致,图 6 中绿色文本结果与黑色文本专家描述高度匹配。
- 训练期间最优的文本丢弃率为 0.5,可在有无文本输入的推理设置下实现最佳性能平衡,兼顾对文本的依赖性与对缺失报告的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。