[论文解读] SAM3D: Segment Anything Model in Volumetric Medical Images
SAM3D 提出了一种轻量级、高效的3D医学图像分割模型,通过先处理2D切片再应用3D解码器捕捉深度方向关系,将预训练的SAM编码器扩展至体素数据。该模型仅使用188万参数即达到最先进性能,在分割精度上优于其他基于SAM和SOTA的模型,同时显著降低模型复杂度。
Image segmentation remains a pivotal component in medical image analysis, aiding in the extraction of critical information for precise diagnostic practices. With the advent of deep learning, automated image segmentation methods have risen to prominence, showcasing exceptional proficiency in processing medical imagery. Motivated by the Segment Anything Model (SAM)-a foundational model renowned for its remarkable precision and robust generalization capabilities in segmenting 2D natural images-we introduce SAM3D, an innovative adaptation tailored for 3D volumetric medical image analysis. Unlike current SAM-based methods that segment volumetric data by converting the volume into separate 2D slices for individual analysis, our SAM3D model processes the entire 3D volume image in a unified approach. Extensive experiments are conducted on multiple medical image datasets to demonstrate that our network attains competitive results compared with other state-of-the-art methods in 3D medical segmentation tasks while being significantly efficient in terms of parameters. Code and checkpoints are available at https://github.com/UARK-AICV/SAM3D.
研究动机与目标
- 解决现有3D医学图像分割模型依赖复杂架构和高参数量的局限性。
- 在不微调整个模型的前提下,将Segment Anything Model (SAM)的能力扩展至体素医学图像。
- 通过捕捉跨切片的3D空间关系,而非孤立处理切片,提升分割性能。
- 开发一种计算高效、参数轻量的框架,在保持高精度的同时实现3D医学图像分割。
提出的方法
- 冻结预训练的SAM图像编码器(ViT-B),以保留来自自然图像的边缘和边界等鲁棒低级特征。
- 将3D体数据的每个2D切片独立输入冻结的SAM编码器,生成形状为 $ \frac{H}{16} \times \frac{W}{16} \times D \times 256 $ 的3D切片嵌入。
- 应用轻量级3D卷积解码器,建模切片嵌入之间的深度关系,实现3D上下文理解。
- 从SAM中移除提示编码器,以避免模态特异性偏差,确保在多样化医学影像模态间的泛化能力。
- 仅端到端训练3D解码器头部,同时保持SAM编码器冻结,最大限度减少参数更新和计算成本。
- 在3D解码器中引入跳跃连接,以保留细粒度特征,提升分割中边缘和边界定位的准确性。
实验结果
研究问题
- RQ1是否可以有效将像SAM这样的预训练2D基础模型适配于3D体素医学图像分割任务,而无需进行完整微调?
- RQ2通过3D解码器捕捉切片间关系,是否能相比逐切片处理方式提升分割性能?
- RQ3轻量级3D解码器是否能在显著减少参数量的前提下,实现与现有SOTA 3D分割模型相当的性能?
- RQ4在多模态3D医学数据集上,SAM3D与其它基于SAM的模型以及Transformer/CNN混合模型相比,在性能和效率方面表现如何?
主要发现
- 在Synapse数据集上,SAM3D的DSC达到77.78%,尽管参数量仅为188万,比参数量为632万的SAMed_s高出1.78%。
- 在ACDC心脏数据集上,SAM3D的DSC相比TransUNet提升0.41%,且参数量不足其1/50。
- 在BraTS脑肿瘤数据集上,SAM3D的DSC比UNETR高出1.8%,且参数量不足其1/20。
- 消融研究证实,3D解码器中的跳跃连接可提升性能,凸显其在保留边界细节方面的作用。
- SAM3D在多种模态和解剖结构上表现出强大泛化能力,涵盖心脏、脑部和肺部分割任务。
- 即使使用最小的SAM变体(ViT-B),模型性能依然具有竞争力,表明采用更大主干网络(如ViT-L、ViT-H)有望进一步提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。