Skip to main content
QUICK REVIEW

[论文解读] SAM Struggles in Concealed Scenes -- Empirical Study on Segment Anything

Ge-Peng Ji, Deng-Ping Fan|arXiv (Cornell University)|Apr 12, 2023
Visual Attention and Saliency Detection参考文献 22被引用 5
一句话总结

本文通过实证评估了分割一切模型(SAM)在隐蔽场景——伪装动物、工业缺陷和医学病灶——中的表现,揭示其与当前最先进模型相比存在显著性能差距。尽管SAM在自然图像中表现出强大的泛化能力,但在低对比度、视觉隐藏的情境下,由于对细微语义线索感知能力有限且缺乏领域特定的归纳偏置,其语义理解能力仍显不足。

ABSTRACT

Segmenting anything is a ground-breaking step toward artificial general intelligence, and the Segment Anything Model (SAM) greatly fosters the foundation models for computer vision. We could not be more excited to probe the performance traits of SAM. In particular, exploring situations in which SAM does not perform well is interesting. In this report, we choose three concealed scenes, i.e., camouflaged animals, industrial defects, and medical lesions, to evaluate SAM under unprompted settings. Our main observation is that SAM looks unskilled in concealed scenes.

研究动机与目标

  • 调查分割一切模型(SAM)在隐蔽场景理解任务中的性能局限。
  • 评估SAM在伪装目标分割(COS)基准上的零样本泛化能力。
  • 识别三种隐蔽场景中的失败案例:伪装动物、工业缺陷和医学病灶。
  • 在无提示设置下,定量比较SAM与当前最先进COS模型的分割性能。
  • 揭示SAM的感知瓶颈,并为提升基础模型在低对比度、语义模糊环境中的表现提供方向。

提出的方法

  • 作者采用基于预测掩码与真实掩码之间交并比(IoU)的掩码选择策略,从多个SAM预测结果中选取最佳输出。
  • 在三个标准伪装目标分割基准上进行定量评估:CAMO、COD10K和NC4K。
  • 采用五项标准指标:结构度量($S_\alpha$)、增强对齐度量($E_\phi$)、F-measure($F_\beta$)、加权F-measure($F_\beta^w$)和平均绝对误差($M$)。
  • 评估在无提示设置下进行,SAM生成多个掩码,选取IoU最高的掩码用于比较。
  • 通过SAM在线演示进行定性分析,可视化三种隐蔽场景中的失败案例。
  • 在一致的主干网络和训练协议下,将SAM(ViT-B、ViT-L、ViT-H)与当前最先进COS模型如CamoFormer-P/S和HitNet进行比较。
Figure 1: SAM [ 1 ] fails to perceive the animals that are visually “hidden” in their natural surroundings. All the samples are from COD10K dataset [ 5 ] .
Figure 1: SAM [ 1 ] fails to perceive the animals that are visually “hidden” in their natural surroundings. All the samples are from COD10K dataset [ 5 ] .

实验结果

研究问题

  • RQ1SAM在伪装目标分割基准上的表现与当前最先进模型相比如何?
  • RQ2为何SAM无法分割伪装动物、工业缺陷和医学病灶等隐蔽目标?
  • RQ3SAM在低对比度、语义模糊场景中的关键失败模式是什么?
  • RQ4将SAM模型规模从ViT-B扩展至ViT-H,能在多大程度上提升其在隐蔽场景中的性能?
  • RQ5通过引入领域特定的归纳偏置或先验知识,能否改善SAM的性能?

主要发现

  • 在CAMO数据集上,SAM(ViT-B)的加权F-measure($F_\beta^w$)仅为0.353,提升至ViT-H后增至0.700,但仍显著低于当前最先进模型。
  • 在COD10K数据集上,SAM(ViT-H)在$E_\phi^{mx}$指标上落后于CamoFormer-S达13.8%,表明其在增强对齐性能方面存在显著差距。
  • 在CAMO数据集上,SAM(ViT-H)与CamoFormer-S之间的$E_\phi^{mx}$差距高达25.6%,表明其在隐蔽场景中泛化能力极差。
  • SAM常将被遮挡或伪装的目标分割为多个不连通的掩码,表明其在模糊区域的语义一致性较弱。
  • 在医学影像中,即使病灶如肿瘤和血管在视觉上明显,SAM仍无法检测到形态不规则的病灶,原因在于缺乏解剖学与病理学知识。
  • 即使扩展至ViT-H,性能差距依然存在,表明仅增加数据规模不足以解决SAM在隐蔽场景中的感知局限。
Figure 2: SAM [ 1 ] is unskilled in detecting concealed defects in industrial scenes. These samples are taken from KolektorSDD [ 17 ] , MagneticTile [ 18 ] , and MVTecAD [ 19 ] datasets.
Figure 2: SAM [ 1 ] is unskilled in detecting concealed defects in industrial scenes. These samples are taken from KolektorSDD [ 17 ] , MagneticTile [ 18 ] , and MVTecAD [ 19 ] datasets.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。