Skip to main content
QUICK REVIEW

[论文解读] DiffMIC: Dual-Guidance Diffusion Network for Medical Image Classification

Yijun Yang, Huazhu Fu|arXiv (Cornell University)|Mar 19, 2023
Machine Learning in Healthcare被引用 4
一句话总结

本论文提出 DiffMIC,首个基于扩散模型的通用医学图像分类方法,通过双粒度条件引导与条件特定的 MMD 正则化,实现图像去噪与鲁棒语义表征学习。该方法在三种多样化的医学影像任务——胎盘成熟度分级、皮肤病变分类与糖尿病视网膜病变分级中均达到最先进性能,显著优于现有方法。

ABSTRACT

Diffusion Probabilistic Models have recently shown remarkable performance in generative image modeling, attracting significant attention in the computer vision community. However, while a substantial amount of diffusion-based research has focused on generative tasks, few studies have applied diffusion models to general medical image classification. In this paper, we propose the first diffusion-based model (named DiffMIC) to address general medical image classification by eliminating unexpected noise and perturbations in medical images and robustly capturing semantic representation. To achieve this goal, we devise a dual conditional guidance strategy that conditions each diffusion step with multiple granularities to improve step-wise regional attention. Furthermore, we propose learning the mutual information in each granularity by enforcing Maximum-Mean Discrepancy regularization during the diffusion forward process. We evaluate the effectiveness of our DiffMIC on three medical classification tasks with different image modalities, including placental maturity grading on ultrasound images, skin lesion classification using dermatoscopic images, and diabetic retinopathy grading using fundus images. Our experimental results demonstrate that DiffMIC outperforms state-of-the-art methods by a significant margin, indicating the universality and effectiveness of the proposed model. Our code will be publicly available at https://github.com/scott-yjyang/DiffMIC.

研究动机与目标

  • 解决跨多种模态的医学图像分类任务中图像噪声大、模糊且语义模糊的挑战。
  • 探索扩散概率模型在生成任务之外的潜力,并将其应用于高层视觉任务,特别是医学图像分类。
  • 通过随机扩散过程对图像进行去噪,同时保留关键解剖细节,以提升特征表征能力。
  • 通过双粒度条件引导整合全局与局部先验,提升分类鲁棒性。
  • 利用条件特定的 MMD 正则化,学习图像与图像块级别特征之间的解耦、共享与鲁棒表征。

提出的方法

  • 采用双粒度条件引导(DCG)策略,在每个扩散步骤中同时基于全局图像级与局部感兴趣区域(ROI)级先验进行条件化,以提升区域注意力与细粒度特征学习能力。
  • 模型在三个输入上应用去噪扩散过程:完整图像、全局先验与局部先验,每个输入在 U-Net 架构中配备独立的噪声预测头。
  • 在前向扩散过程中施加条件特定的最大均值差异(MMD)正则化,以最大化图像级与图像块级潜在表征之间的互信息。
  • 噪声预测通过组合噪声嵌入上的均方误差(MSE)损失进行训练,而 MMD 损失则应用于全局与局部分支的预测噪声,以对齐其分布。
  • 图像编码器提取特征嵌入,与扩散 U-Net 输出的去噪潜在特征融合,生成最终的分类 logits。
  • 反向扩散过程逐步去除特征噪声,使推理时的表征更加清晰且类别分离,通过 t-SNE 可视化结果得以体现。

实验结果

研究问题

  • RQ1基于扩散的模型能否通过去噪与增强语义表征,有效提升通用医学图像分类性能?
  • RQ2双粒度条件引导(结合全局与局部先验)在医学图像中如何提升注意力机制与分类性能?
  • RQ3条件特定的 MMD 正则化在扩散过程中在多大程度上增强了潜在空间中的特征解耦与鲁棒性?
  • RQ4所提出的 DiffMIC 模型是否能在超声、皮肤镜与眼底成像等多样化的医学影像模态中实现泛化?
  • RQ5与传统 CNN 与视觉 Transformer 相比,扩散建模的集成在类别不平衡的医学数据集上,在准确率与鲁棒性方面表现如何?

主要发现

  • 在胎盘成熟度分级的 PMG2000 数据集中,DiffMIC 达到 0.931 的准确率与 0.926 的 F1 分数,优于第二名方法(PVT)0.024 的准确率与 0.024 的 F1 分数。
  • 在皮肤病变分类的 HAM10000 数据集中,与第二名方法 ProCo 相比,DiffMIC 准确率提升 0.019,F1 分数提升 0.053。
  • 在糖尿病视网膜病变分级的 APTOS2019 数据集中,DiffMIC 准确率高出 ProCo 0.021,F1 分数高出 0.042,展现出在类别不平衡数据上的强劲性能。
  • 消融实验表明,每个组件——扩散过程、DCG 与 MMD 正则化——均对性能有增量贡献,完整模型相比基线(ResNet18)准确率提升 0.052。
  • t-SNE 可视化显示,随着扩散过程推进,特征嵌入逐渐呈现更清晰的类别分离,表明噪声有效去除与表征有效优化。
  • 该模型在三种截然不同的医学影像模态中均表现出泛化能力:超声(胎盘)、皮肤镜(皮肤病变)与眼底(糖尿病视网膜病变),证实其通用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。