[论文解读] CMU-Net: A Strong ConvMixer-based Medical Ultrasound Image Segmentation Network
CMU-Net 是一种用于医学超声图像分割的新型全卷积神经网络,通过引入 ConvMixer 模块捕捉全局上下文,并采用多尺度注意力门机制增强跳跃连接。在 BUSI 数据集上实现 73.27% 的平均 IoU 和 84.16% 的 F1 分数,在 TUS 数据集上实现 84.75% 的 IoU 和 91.71% 的 F1 分数,优于 U-Net 和基于 Transformer 的模型,在小样本数据集上表现卓越。
U-Net and its extensions have achieved great success in medical image segmentation. However, due to the inherent local characteristics of ordinary convolution operations, U-Net encoder cannot effectively extract global context information. In addition, simple skip connections cannot capture salient features. In this work, we propose a fully convolutional segmentation network (CMU-Net) which incorporates hybrid convolutions and multi-scale attention gate. The ConvMixer module extracts global context information by mixing features at distant spatial locations. Moreover, the multi-scale attention gate emphasizes valuable features and achieves efficient skip connections. We evaluate the proposed method using both breast ultrasound datasets and a thyroid ultrasound image dataset; and CMU-Net achieves average Intersection over Union (IoU) values of 73.27% and 84.75%, and F1 scores of 84.81% and 91.71%. The code is available at https://github.com/FengheTan9/CMU-Net.
研究动机与目标
- 为解决 U-Net 局部感受野在捕捉超声图像全局上下文方面的局限性。
- 通过用可学习的注意力机制替代简单的拼接操作,改进跳跃连接中的特征传输。
- 开发一种高效、全卷积的网络架构,在小样本医学图像数据集上实现高性能,且计算成本适中。
- 验证 ConvMixer 和多尺度注意力门在提升乳腺和甲状腺超声图像分割精度方面的有效性。
提出的方法
- 编码器采用标准的 3×3 卷积,随后接一个使用大核深度可分离卷积和逐点卷积的 ConvMixer 模块,以聚合长距离空间依赖关系。
- ConvMixer 模块应用 7×7 的深度可分离卷积和 1×1 的逐点卷积,随后接 GELU 激活函数和批量归一化。
- 引入多尺度注意力门,通过在多个尺度上学习注意力权重,抑制无关特征并突出显著特征,以增强跳跃连接中的特征表达。
- 解码器采用双线性上采样与门控特征拼接相结合的方式,以精细化分割掩码。
- 网络采用混合损失函数进行训练,结合二元交叉熵损失和 Dice 损失,以平衡类别不平衡问题。
- 实验中采用数据增强技术,包括随机旋转和翻转,输入图像调整为 256×256 尺寸,训练周期为 300 个轮次,批量大小为 8。
实验结果
研究问题
- RQ1基于 ConvMixer 的编码器是否能有效捕捉在局部卷积失效的超声图像中的全局上下文?
- RQ2与标准拼接方式相比,所提出的多尺度注意力门是否能提升跳跃连接中的特征传输性能?
- RQ3CMU-Net 在小样本医学超声图像数据集上的表现是否优于 U-Net 和基于 Transformer 的模型(如 TransUnet)?
- RQ4在该分割任务中,ConvMixer 模块的最佳深度和核大小为何?
- RQ5消融实验中,ConvMixer 模块和注意力门组件对最终性能提升的贡献程度如何?
主要发现
- 在 BUSI 乳腺超声图像数据集上,CMU-Net 实现了 73.27% 的平均交并比(IoU)和 84.16% 的 F1 分数,IoU 比 U-Net 提升 2.89 个百分点,F1 分数提升 2.00 个百分点。
- 在 TUS 甲状腺超声图像数据集上,CMU-Net 实现 84.75% 的 IoU 和 91.71% 的 F1 分数,优于所有对比模型,包括 TransUnet。
- 消融实验表明,加入 ConvMixer 模块后,IoU 从原始 U-Net 的 68.49% 提升至 72.36%,再引入多尺度注意力门后进一步提升至 73.27%。
- 多尺度注意力门通过突出相关特征,显著增强了知识迁移能力,各项指标均呈现一致的性能增益。
- CMU-Net 在多个随机划分下保持高达 97.33% 的准确率和强鲁棒性,表明其在小样本数据集上具有优异的泛化能力。
- CMU-Net 在小样本数据集上优于 TransUnet,表明基于 ConvMixer 的方法比混合 CNN-Transformer 架构更具数据效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。