Skip to main content
QUICK REVIEW

[论文解读] Boosting Dermatoscopic Lesion Segmentation via Diffusion Models with Visual and Textual Prompts

Shiyi Du, Xiaosong Wang|arXiv (Cornell University)|Oct 4, 2023
Cutaneous Melanoma Detection and Management被引用 4
一句话总结

该论文提出了一种基于扩散模型的框架,通过结合视觉和文本提示生成高保真度的皮肤镜图像,精确捕捉病变特征,显著提升了皮肤病变分割性能。通过整合病变类型、形状、位置及属性作为提示,该方法在SSIM上相比先前的GAN方法提升了9%,Dice系数提升超过5%。

ABSTRACT

Image synthesis approaches, e.g., generative adversarial networks, have been popular as a form of data augmentation in medical image analysis tasks. It is primarily beneficial to overcome the shortage of publicly accessible data and associated quality annotations. However, the current techniques often lack control over the detailed contents in generated images, e.g., the type of disease patterns, the location of lesions, and attributes of the diagnosis. In this work, we adapt the latest advance in the generative model, i.e., the diffusion model, with the added control flow using lesion-specific visual and textual prompts for generating dermatoscopic images. We further demonstrate the advantage of our diffusion model-based framework over the classical generation models in both the image quality and boosting the segmentation performance on skin lesions. It can achieve a 9% increase in the SSIM image quality measure and an over 5% increase in Dice coefficients over the prior arts.

研究动机与目标

  • 通过生成多样化、高质量的合成病变图像,解决罕见病变类型和属性的标注皮肤镜图像稀缺问题。
  • 通过引入病变特异性视觉与文本提示,提升医学图像生成的可控性。
  • 通过所提出的生成框架进行数据增强,提升下游皮肤病变分割性能。
  • 证明扩散模型在生成具有精确病变属性的逼真、细节丰富的皮肤镜图像方面优于GAN。
  • 开发一种自动病变形状与掩码生成模块,实现可扩展的数据增强。

提出的方法

  • 以Stable Diffusion模型作为图像生成主干网络,通过视觉(分割掩码)和文本(病变类型与属性)提示进行条件控制。
  • 采用ControlNet引导扩散过程,实现在图像生成过程中对病变形状、位置和外观的精确控制。
  • 引入一个自动模块,生成具有不同尺寸、形状和解剖位置的多样化病变分割掩码,以丰富训练数据。
  • 使用公开的皮肤镜数据集(ISIC)进行模型训练,其中ISIC 2017和2019年数据集提供的病变类型与属性信息作为文本提示。
  • 将生成的图像作为增强训练数据,用于下游病变分割任务,采用Dice损失和基于U-Net的分割网络进行训练。
  • 在相同的训练与评估协议下,对Pix2PixHD这一强基准GAN方法进行消融实验与对比研究。

实验结果

研究问题

  • RQ1与GAN相比,结合视觉与文本提示的扩散模型能否生成保真度更高、对病变属性控制更优的皮肤镜图像?
  • RQ2使用所提出的生成框架进行数据增强,能在多大程度上提升皮肤病变分割性能?
  • RQ3整合病变特异性提示(类型、形状、位置、属性)对图像质量和下游任务准确率有何影响?
  • RQ4自动病变掩码生成模块是否能有效提升合成病变数据的多样性与覆盖范围?
  • RQ5该框架是否可迁移至其他需要对罕见或异常病例进行受控生成的医学影像任务?

主要发现

  • 所提出的基于扩散模型的框架在SSIM上相比Pix2PixHD GAN基线相对提升了9%,表明图像质量与细节保持能力更优。
  • 与先前方法相比,Dice系数提升超过5%,在使用5,000张合成图像时,最终分割DSC达到0.914。
  • 生成图像在纹理与病变结构保真度方面表现更优,图4中放大区域的视觉对比已明确证实。
  • 在不同规模的合成数据(1,000、3,000、5,000张)下性能提升保持一致,且在3,000张样本后边际增益极小。
  • 当使用合成数据增强时,该框架在性能上优于SOTA的U-Net模型(DSC 0.861)与DCSAU-Net模型(DSC 0.903)。
  • 结合视觉与文本提示可实现对病变特征的精确控制,支持针对罕见或复杂病例的定向数据生成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。