[论文解读] Biomedical SAM 2: Segment Anything in Biomedical Images and Videos
本文提出 BioSAM-2,一种基于 SAM-2 微调的通用基础模型,可实现高精度的零样本生物医学图像与视频分割。通过集成记忆机制与流式处理,BioSAM-2 在 8 种医学影像模态和 22 种目标上实现了最先进性能,其分割精度优于通用基础模型与专用模型,且无需提示输入。
Medical image segmentation and video object segmentation are essential for diagnosing and analyzing diseases by identifying and measuring biological structures. Recent advances in natural domain have been driven by foundation models like the Segment Anything Model 2 (SAM-2). To explore the performance of SAM-2 in biomedical applications, we designed three evaluation pipelines for single-frame 2D image segmentation, multi-frame 3D image segmentation and multi-frame video segmentation with varied prompt designs, revealing SAM-2's limitations in medical contexts. Consequently, we developed BioSAM-2, an enhanced foundation model optimized for biomedical data based on SAM-2. Our experiments show that BioSAM-2 not only surpasses the performance of existing state-of-the-art foundation models but also matches or even exceeds specialist models, demonstrating its efficacy and potential in the medical domain.
研究动机与目标
- 评估 SAM-2 在生物医学影像与视频中的零样本分割性能,识别其在医学场景下的局限性。
- 通过开发针对医学数据定制的专用基础模型,弥合自然图像与生物医学图像之间的领域差距。
- 设计并验证三种评估流程:分别用于单帧 2D 图像分割、多帧 3D 图像分割以及多帧视频分割,覆盖多种医学影像模态。
- 证明 BioSAM-2 在医学数据上的分割精度超越现有基础模型,并与或超过专用模型的性能。
- 通过引入记忆增强的流式推理架构,实现在生物医学序列中无需提示的自动化分割。
提出的方法
- BioSAM-2 基于原始 SAM-2 架构,使用涵盖 8 种医学影像模态和 22 种解剖结构的生物医学数据集进行微调。
- 该模型采用记忆机制,保留并利用跨帧的先前预测结果,以提升多帧分割中的时间一致性。
- 流式处理架构支持顺序推理,使模型能够在无需显式提示的情况下对新帧做出准确预测。
- 设计了三种评估流程:一种用于单帧 2D 图像分割,一种用于多帧 3D 图像分割,一种用于多帧视频分割,并采用不同类型的提示(如 1 点、3 点、5 点)。
- 采用交并比(IoU)和 F-Score 作为评估指标,与基于 CNN、Transformer、SSM 的模型以及专用模型进行对比。
- 该框架支持零样本推理,仅需极少人工干预,即使在无提示条件下也能实现自动化分割。
实验结果
研究问题
- RQ1SAM-2 在未经微调的情况下,能否有效泛化至生物医学图像与视频分割任务?
- RQ2SAM-2 在医学场景中的关键局限性是什么,特别是其在语义理解与领域偏移方面的问题?
- RQ3记忆机制与流式处理的集成如何提升医学影像中时间序列分割的性能?
- RQ4BioSAM-2 在零样本生物医学分割任务中,相较于现有基础模型与专用模型,性能提升程度如何?
- RQ5通过优化后的基础模型,是否可在复杂生物医学视频序列中可靠地实现无需提示的自动化分割?
主要发现
- 由于存在显著的领域差距,且无法将分割区域与语义解剖类别关联,SAM-2 在生物医学分割任务中表现欠佳。
- 在 EchoNet-Dynamic 数据集上,SAM-2(Hiera-L)在 3 点提示下取得 72.5% 的 Jaccard-F 分数,但未经领域特定适配时性能仍不理想。
- BioSAM-2 在全部 8 种医学影像模态和 22 个感兴趣对象上均达到最先进性能,优于在相同数据上训练的通用基础模型与专用模型。
- 在视频分割中,随着交互帧数的增加,BioSAM-2 的性能显著提升,在某些情况下甚至超过真实标签掩码的性能(尤其在 3 点提示下)。
- 在 EchoNet-Dynamic 数据集上,BioSAM-2 在 8 个交互帧和 3 次点击下取得 72.5% 的 Jaccard-F 分数,展现出强大的时间建模能力与鲁棒性。
- 值得注意的是,BioSAM-2 在无需任何提示的情况下实现了稳定且高精度的分割,在自动化设置中显著优于竞争性的最先进基础模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。