Skip to main content
QUICK REVIEW

[论文解读] Rethinking Evaluation Metrics of Open-Vocabulary Segmentaion

Hao Zhou, Tiancheng Shen|arXiv (Cornell University)|Nov 6, 2023
Natural Language Processing Techniques被引用 4
一句话总结

本文提出了 Open mIoU、Open AP 和 Open PQ——用于开放词汇图像分割的新型评估指标,通过使用语义相似度替代二值真阳性,实现基于相似度的软评分。利用 WordNet 路径相似度,这些指标在零样本和跨数据集设置下更符合人类判断,并在评估模型泛化能力方面展现出更优的一致性,突破了封闭集假设的限制。

ABSTRACT

In this paper, we highlight a problem of evaluation metrics adopted in the open-vocabulary segmentation. That is, the evaluation process still heavily relies on closed-set metrics on zero-shot or cross-dataset pipelines without considering the similarity between predicted and ground truth categories. To tackle this issue, we first survey eleven similarity measurements between two categorical words using WordNet linguistics statistics, text embedding, and language models by comprehensive quantitative analysis and user study. Built upon those explored measurements, we designed novel evaluation metrics, namely Open mIoU, Open AP, and Open PQ, tailored for three open-vocabulary segmentation tasks. We benchmarked the proposed evaluation metrics on 12 open-vocabulary methods of three segmentation tasks. Even though the relative subjectivity of similarity distance, we demonstrate that our metrics can still well evaluate the open ability of the existing open-vocabulary segmentation methods. We hope that our work can bring with the community new thinking about how to evaluate the open ability of models. The evaluation code is released in github.

研究动机与目标

  • 识别现有开放词汇分割评估指标的关键缺陷:依赖于封闭集指标,忽略预测类别与真实类别之间的语义相似度。
  • 研究并比较 11 种词相似度度量方法——WordNet、文本嵌入(GloVe、FastText、Word2Vec)以及预训练语言模型(CLIP、BERT、GPT、T5)——在开放词汇评估中的适用性。
  • 设计专用于开放词汇语义分割、实例分割和全景分割任务的新评估指标——Open mIoU、Open AP 和 Open PQ。
  • 在三个任务上对 12 种最先进开放词汇分割模型进行基准测试,以验证所提指标的有效性及其与人类感知的一致性。
  • 通过在评估流程中引入语义相似度,推动评估范式变革,实现对模型泛化能力的更全面评估,超越严格的类别匹配要求。

提出的方法

  • 采用类别无关的匹配策略,识别预测掩码与真实掩码之间最高的 IoU,无论类别标签如何,以避免严格的类别匹配。
  • 将二值真阳性(TP)、假阳性(FP)和假阴性(FN)分数替换为基于预测类别与真实类别之间语义相似度的软分数。
  • 采用 WordNet 路径相似度作为首选相似度度量,因其具有适中的取值范围、区分多义性的能力、数据独立性以及与人类认知的一致性。
  • 构建 Open mIoU 用于语义分割,Open AP 用于实例分割,Open PQ 用于全景分割,每项指标均整合 IoU 与基于相似度的评分。
  • 在三个任务中应用这些指标:在 COCO 和 ADE20K 上进行数据集内与跨数据集设置,对不同相似度方法(Path、GloVe、T5)进行消融研究。
  • 开展一项包含 1,000 名参与者的用户研究,以验证基于路径相似度方法的评估结果在人类偏好上优于其他相似度度量。

实验结果

研究问题

  • RQ1当预测结果与真实标签在语义上相似但不完全相同时,现有封闭集评估指标为何无法准确反映分割模型的真实开放世界性能?
  • RQ2在 11 种词相似度度量方法(WordNet、文本嵌入、预训练语言模型)中,哪一种在开放词汇评估中能最好地平衡可解释性、鲁棒性与人类感知的一致性?
  • RQ3与原始指标相比,所提出的开放指标(Open mIoU、Open AP、Open PQ)在零样本和跨数据集设置下,其评估一致性与人类感知对齐程度提升到何种程度?
  • RQ4当预测标签错误但语义相似时,新指标对分割质量与分类准确性的敏感性如何,尤其是在此类情况下?
  • RQ5所提指标能否推广至不同分割任务(语义、实例、全景)及检测任务?其改进效果在不同数据集和 IoU 阈值下是否稳定?

主要发现

  • 在包含 1,000 名参与者的用户研究中,WordNet 的路径相似度方法获得了最高的人类满意度评分(平均 6.12 / 10),显著优于 GloVe(3.05)和 T5(4.29),表明其在感知上更符合人类判断。
  • Open AP 在实例分割的全部数据集内与跨数据集设置中均持续优于原始 AP,尤其在新类别上提升更大,表明其对语义相似度具有高度敏感性。
  • Open RQ 在目标数据集(ADE20K)上的改进幅度显著大于源数据集(COCO),验证了其对语义距离的敏感性,以及在开放世界设置中捕捉识别质量的能力。
  • Open PQ 展现出对分割质量的强敏感性,当预测标签错误但语义相似度高时,能正确赋予更高的分数,表明其在开放词汇场景下对误分类具有鲁棒性。
  • 消融研究证实,使用路径方法的 Open PQ 产生了适中且可靠的结果,而 GloVe 和 T5 则高估了识别质量,提示基于嵌入的相似度度量可能存在偏差。
  • 所提指标,尤其是 Open AP 和 Open PQ,在不同 IoU 阈值和任务(包括目标检测)中均表现出稳定改进,表明其具有广泛的适用性与鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。