[论文解读] Prompt-Based Segmentation at Multiple Resolutions and Lighting Conditions using Segment Anything Model 2
本研究评估了基于提示的分割方法在不同分辨率(0.15 m 和 0.25 m)和光照条件下,使用 Segment Anything Model 2(SAM 2)和传统卷积神经网络(Eff-UNet)进行航拍影像中太阳能电池板检测的性能。SAM 2 在光照不佳时表现优于 SAM,且 YOLOv9 生成的边界框作为提示显著提升了准确率,优于人工点击的点提示;在高分辨率数据中,Eff-UNet 略胜于 SAM 2(使用 YOLO 提示),因其对提示偏差导致的误报更少。
This paper provides insights on the effectiveness of the zero shot, prompt-based Segment Anything Model (SAM) and its updated versions, SAM 2 and SAM 2.1, along with the non-promptable conventional neural network (CNN), for segmenting solar panels in RGB aerial remote sensing imagery. The study evaluates these models across diverse lighting conditions, spatial resolutions, and prompt strategies. SAM 2 showed slight improvements over SAM, while SAM 2.1 demonstrated notable improvements, particularly in sub-optimal lighting and low resolution conditions. SAM models, when prompted by user-defined boxes, outperformed CNN in all scenarios; in particular, user-box prompts were found crucial for achieving reasonable performance in low resolution data. Additionally, under high resolution, YOLOv9 automatic prompting outperformed user-points prompting by providing reliable prompts to SAM. Under low resolution, SAM 2.1 prompted by user points showed similar performance to SAM 2.1 prompted by YOLOv9, highlighting its zero shot improvements with a single click. In high resolution with optimal lighting imagery, Eff-UNet outperformed SAMs prompted by YOLOv9, while under sub-optimal lighting conditions, Eff-UNet, and SAM 2.1 prompted by YOLOv9, had similar performance. However, SAM is more resource-intensive, and despite improved inference time of SAM 2.1, Eff-UNet is more suitable for automatic segmentation in high resolution data. This research details strengths and limitations of each model and outlines the robustness of user-prompted image segmentation models.
研究动机与目标
- 评估基于提示的 SAM 2 与传统卷积神经网络(Eff-UNet)在不同遥感图像条件下分割太阳能电池板的性能。
- 评估不同提示策略(用户创建的点、用户绘制的边界框,以及 YOLOv9 生成的边界框)对 SAM 和 SAM 2 分割准确率的影响。
- 在低分辨率与高分辨率、理想光照与次优光照条件下,比较完全自动(Eff-UNet)与半自动(SAM/SAM 2 配合人工提示)方法的性能。
- 识别各模型在处理不一致遥感数据时的优势与局限性,特别是对分辨率和光照变化的鲁棒性。
提出的方法
- 本研究使用来自以色列贝埃拉市(Be’er Sheva)的三组机载数据集(2015 年、2017 年、2022 年),空间分辨率为 0.25 m(低)和 0.15 m(高),并涵盖不同光照条件。
- 评估的分割模型包括:(1) SAM 2 和 SAM(基于提示),(2) Eff-UNet(完全自动的 CNN),以及 (3) 由 YOLOv9 目标检测边界框提示的 SAM/SAM 2。
- 测试的提示策略包括:用户点击的点、用户绘制的边界框,以及 YOLOv9 生成的边界框,用于 SAM 和 SAM 2。
- 性能评估指标包括 IoU、F1-score、精确率、召回率和准确率,覆盖所有数据集,每组数据集标注了 3000 个太阳能电池板。
- YOLOv9 模型用于生成目标建议框作为 SAM 和 SAM 2 的提示,实现端到端的自动化提示生成。
- Eff-UNet 使用复合缩放的 EfficientNet 编码器与 U-Net 解码器结构,基于 ImageNet 预训练特征进行端到端训练以实现分割。
实验结果
研究问题
- RQ1在次优光照和低分辨率条件下,SAM 2 与 SAM 在太阳能电池板分割中的表现如何比较?
- RQ2YOLOv9 生成的边界框提示是否在 SAM 和 SAM 2 的太阳能电池板分割中优于人工点击的点提示?
- RQ3在不同图像分辨率和光照条件下,完全自动的 Eff-UNet 与基于提示的 SAM 和 SAM 2 的性能如何比较?
- RQ4提示质量与模型架构对遥感图像分割中误报率的影响是什么?
主要发现
- 在次优光照条件下,SAM 2 使用用户绘制的边界框作为提示时,IoU 达到 0.75,F1-score 达到 0.85,显著优于 SAM(IoU:0.74,F1:0.84)。
- 当使用点作为提示时,SAM 2 表现优于 SAM,IoU 达 0.51,F1-score 达 0.62,而 SAM 的对应值为 IoU 0.49 和 F1 0.61。
- YOLOv9 生成的边界框作为提示时,准确率高于人工点击的点提示,SAM 2 的 IoU 为 0.54,F1-score 为 0.63,而点提示的对应值为 0.49 和 0.61。
- 在高分辨率影像中,Eff-UNet 的 IoU 为 0.55,F1-score 为 0.64,略高于使用 YOLOv9 提示的 SAM 2(IoU:0.54,F1:0.63),表明其对提示偏差具有更强的鲁棒性。
- 在低分辨率条件下,用户绘制的边界框提示对实现合理性能至关重要,因为未使用此类提示的 SAM 模型在分割准确率上表现较差。
- SAM 模型对提示质量更敏感,当输入不完美的 YOLOv9 边界框时,误报率显著上升;而 Eff-UNet 在所有条件下均表现出更一致的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。