Skip to main content
QUICK REVIEW

[论文解读] Rethinking Semantic Segmentation Evaluation for Explainability and Model Selection

Yuxiang Zhang, Sachin Mehta|arXiv (Cornell University)|Jan 21, 2021
Advanced Neural Network Applications参考文献 30被引用 17
一句话总结

本文提出基于区域的过分割与欠分割度量(ROM 和 RUM),以提升语义分割任务中模型的可解释性与模型选择能力,解决 mIOU 等像素级度量的局限性。该方法通过测量预测结果与真实区域之间的偏差,量化区域层面的保真度,揭示出轻量化模型的欠分割现象主要源于结构偏差,而非像素准确率的下降。

ABSTRACT

Semantic segmentation aims to robustly predict coherent class labels for entire regions of an image. It is a scene understanding task that powers real-world applications (e.g., autonomous navigation). One important application, the use of imagery for automated semantic understanding of pedestrian environments, provides remote mapping of accessibility features in street environments. This application (and others like it) require detailed geometric information of geographical objects. Semantic segmentation is a prerequisite for this task since it maps contiguous regions of the same class as single entities. Importantly, semantic segmentation uses like ours are not pixel-wise outcomes; however, most of their quantitative evaluation metrics (e.g., mean Intersection Over Union) are based on pixel-wise similarities to a ground-truth, which fails to emphasize over- and under-segmentation properties of a segmentation model. Here, we introduce a new metric to assess region-based over- and under-segmentation. We analyze and compare it to other metrics, demonstrating that the use of our metric lends greater explainability to semantic segmentation model performance in real-world applications.

研究动机与目标

  • 解决语义分割中缺乏能够反映区域级错误(如过分割与欠分割)的可解释性评估度量的问题。
  • 识别出标准度量如 mIOU 尽管像素级误差较低,却无法检测到区域级分割错误。
  • 开发一种基于区域的评估框架,独立量化过分割与欠分割,实现更优的模型比较与选择。
  • 为实际应用(尤其是行人环境建图)提供实用解决方案,其中区域连通性与目标连续性至关重要。
  • 实现计算效率与分割保真度之间的平衡,尤其适用于资源受限环境中轻量化模型的选择。

提出的方法

  • 将区域过分割度量(ROM)定义为与多个真实区域重叠的预测区域所占比例,用以指示错误的分裂。
  • 将区域欠分割度量(RUM)定义为被多个预测区域重叠的真实区域所占比例,用以指示错误的合并。
  • 使用连通域分析从分割掩码中提取预测区域与真实区域。
  • 利用预测区域与真实区域之间的交并比(IoU)计算 ROM 和 RUM,以评估区域层面的一致性。
  • 将 ROM 和 RUM 整合进模型评估流程,与 mIOU、Dice 和像素准确率等标准度量并行使用。
  • 在多种数据集(PASCAL VOC、Cityscapes、ADE20K)和模型架构(重型与轻量化)上应用该度量,验证其鲁棒性与实用性。

实验结果

研究问题

  • RQ1标准像素级评估度量(如 mIOU)为何无法捕捉过分割与欠分割等区域级分割错误?
  • RQ2ROM 和 RUM 在多大程度上能够解释重型与轻量化模型在语义分割中的性能差异?
  • RQ3在实际应用中,区域级度量(如 ROM 和 RUM)是否能比像素级度量提供更具可解释性的模型行为洞察?
  • RQ4ROM 和 RUM 与下游应用需求(如行人环境中的精确路径映射)之间的相关性如何?
  • RQ5边界模糊性与非确定性图像边界在多大程度上影响区域级评估度量的鲁棒性?

主要发现

  • 在 PASCAL VOC 的一个示例中,尽管像素级分割近乎完美,mIOU 仍显示不可忽视的误差,而 ROM 和 RUM 正确报告了零过分割或欠分割,证明其对区域级保真度的敏感性。
  • 在 Cityscapes 数据集中,ESPNetv2 的 RUM 比 DRN 高 5 个百分点,尽管两者 ROM 相近,表明其性能下降主要源于欠分割,而非过分割。
  • 在 ADE20K 上,MobileNetv2 的 ROM 显著高于 PSPNet-ResNet101,揭示其性能较低主要源于过分割,而非像素级误差。
  • 在置信度阈值为 0.6 时,MobileNetv2 降低了过分割误差,且未恶化欠分割误差,表明通过调整阈值可缓解区域级错误。
  • 该度量揭示出轻量化模型(如 ESPNetv2 和 MobileNetv2)常对关键物体(如电线杆、行人)产生过分割或欠分割,这对导航任务至关重要,但 mIOU 无法察觉。
  • ROM 和 RUM 对边界变化具有鲁棒性,因为标注边界与自然图像边界本身均具有非确定性,使度量在真实输入中保持稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。