[论文解读] Medical Image Segmentation via Sparse Coding Decoder
该论文提出CASCSCDE,一种新颖的级联多层卷积稀疏向量编码解码器,通过将特征表示为稀疏向量来提升医学图像分割中的空间细节恢复能力。与TransUNet结合后,在Synapse多器官分割基准上,Dice分数提升3.15%,mIoU提升1.16%,通过稀疏编码与多层级特征融合,展现出更优的边界重建能力与鲁棒性。
Transformers have achieved significant success in medical image segmentation, owing to its capability to capture long-range dependencies. Previous works incorporate convolutional layers into the encoder module of transformers, thereby enhancing their ability to learn local relationships among pixels. However, transformers may suffer from limited generalization capabilities and reduced robustness, attributed to the insufficient spatial recovery ability of their decoders. To address this issue, A convolution sparse vector coding based decoder is proposed , namely CAScaded multi-layer Convolutional Sparse vector Coding DEcoder (CASCSCDE), which represents features extracted by the encoder using sparse vectors. To prove the effectiveness of our CASCSCDE, The widely-used TransUNet model is chosen for the demonstration purpose, and the CASCSCDE is incorporated with TransUNet to establish the TransCASCSCDE architecture. Our experiments demonstrate that TransUNet with CASCSCDE significantly enhances performance on the Synapse benchmark, obtaining up to 3.15\% and 1.16\% improvements in DICE and mIoU scores, respectively. CASCSCDE opens new ways for constructing decoders based on convolutional sparse vector coding.
研究动机与目标
- 解决基于Transformer的解码器在医学图像分割中空间恢复能力有限及鲁棒性下降的问题。
- 通过利用稀疏向量表示,提升分割任务的泛化能力与抗噪能力。
- 开发一种能有效融合高层语义特征与低层空间细节的解码器,以实现精确的边界定位。
- 展示卷积稀疏编码在级联多层架构中用于2D医学图像分割的有效性。
提出的方法
- CASCSCDE解码器采用级联多层卷积稀疏编码框架,将编码器提取的特征表示为稀疏向量。
- 其通过可学习神经模块(ML-block)中的迭代优化,交替使用转置卷积与残差误差校正,以逐步优化特征重建。
- ML-block通过学习的权重W1、W2及缩放因子c1、c2执行迭代更新,结合批量归一化与ReLU激活,以增强稀疏性与稳定性。
- 将解码器集成至TransUNet架构中,替换其原始解码器,形成TransCASCSCDE,支持端到端训练。
- 通过多层结构实现稀疏编码,有效抑制无关信息,提升特征的可解释性与鲁棒性。
- 模型在Synapse数据集上通过随机翻转与旋转进行数据增强,并联合使用交叉熵损失与Dice损失进行训练。
实验结果
研究问题
- RQ1基于稀疏编码的解码器能否提升视觉Transformer编码器在医学图像分割中的空间细节恢复能力?
- RQ2与标准反卷积解码器相比,多层卷积稀疏编码在分割精度与鲁棒性方面表现如何?
- RQ3在稀疏编码过程中,迭代优化步骤数T的最优值是多少,以实现稀疏性与性能之间的平衡?
- RQ4所提出的CASCSCDE解码器在不同大小器官(尤其是小器官与复杂结构器官)上是否具备良好的泛化能力?
- RQ5稀疏编码在多大程度上提升了医学图像分割的抗噪能力与边界精确度?
主要发现
- 与基线模型TransUNet相比,TransCASCSCDE在Synapse多器官分割基准上实现了3.15%的绝对Dice分数提升(达到80.63%)
- mIoU提升1.16%,表明整体分割一致性与边界定位能力显著增强。
- 小器官分割性能显著提升:胆囊+4.05%,左肾+2.13%,右肾+1.11%。
- 大器官同样受益:胃+6.69%,脾+3.47%,胰腺+1.94%,表明在复杂结构上表现优异。
- 消融实验表明,T=2时性能最优,进一步增加T(至3和4)导致性能下降,原因在于过度稀疏表示。
- 稀疏编码机制有效抑制噪声与无关特征,显著增强模型在多样化解剖结构上的鲁棒性与泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。