Skip to main content
QUICK REVIEW

[论文解读] GRIT: General Robust Image Task Benchmark

Tanmay Gupta, Ryan Marten|arXiv (Cornell University)|Apr 28, 2022
Domain Adaptation and Few-Shot Learning被引用 11
一句话总结

GRIT 提出了一项统一基准,用于评估视觉模型在七项核心视觉与视觉-语言任务(对象分类、定位、指代表达、VQA、分割、关键点检测和表面法线估计)中的泛化性、鲁棒性和校准性,覆盖多种数据源、概念和图像扰动。该基准通过两个赛道实现模型的公平比较:Restricted(适用于零样本迁移和数据效率)与 Unrestricted(适用于大规模基础模型),关键结果表明在分布偏移下性能显著下降,且存在强烈的校准权衡。

ABSTRACT

Computer vision models excel at making predictions when the test distribution closely resembles the training distribution. Such models have yet to match the ability of biological vision to learn from multiple sources and generalize to new data sources and tasks. To facilitate the development and evaluation of more general vision systems, we introduce the General Robust Image Task (GRIT) benchmark. GRIT evaluates the performance, robustness, and calibration of a vision system across a variety of image prediction tasks, concepts, and data sources. The seven tasks in GRIT are selected to cover a range of visual skills: object categorization, object localization, referring expression grounding, visual question answering, segmentation, human keypoint detection, and surface normal estimation. GRIT is carefully designed to enable the evaluation of robustness under image perturbations, image source distribution shift, and concept distribution shift. By providing a unified platform for thorough assessment of skills and concepts learned by a vision model, we hope GRIT catalyzes the development of performant and robust general purpose vision systems.

研究动机与目标

  • 为解决在 i.i.d. 设置之外评估视觉模型时缺乏统一基准的问题,特别是针对分布偏移和概念迁移。
  • 支持对 20 种图像失真类型的模型鲁棒性评估,包括 JPEG 压缩、模糊和对抗性扰动。
  • 支持大规模基础模型(Unrestricted 赛道)和高效、数据高效模型(Restricted 赛道),并控制训练数据访问。
  • 通过置信度分数评估模型校准性,衡量预测的可靠性和自我意识。
  • 推动开发能够跨任务、概念和数据源泛化的通用视觉系统,类似于人类的视觉理解能力。

提出的方法

  • GRIT 围绕七项核心任务构建,涵盖广泛的视觉技能:对象分类、定位、指代表达定位、VQA、语义分割、人体关键点检测和表面法线估计。
  • 基准使用清晰明确、已存在的数据集并采用标准化标注,以确保评估的一致性并减少歧义。
  • 评估涵盖三个关键维度:(1) 在新数据源上的表现(分布偏移),(2) 在新概念上的表现(概念偏移),(3) 对 20 种图像扰动类型的鲁棒性。
  • 要求模型为每个预测输出置信度分数,以支持使用 RMSE 和自我意识指标进行校准性评估。
  • 定义了两个评估赛道:Restricted(仅限特定公开数据源)和 Unrestricted(除消融/测试集外的任意数据),实现跨计算规模的公平比较。
  • 对每个样本计算评估指标,并在子集(如新数据源、新概念)上取平均,以实现对泛化性和鲁棒性的细粒度分析。

实验结果

研究问题

  • RQ1视觉模型在训练中未见过的新数据源和新概念上泛化能力如何?
  • RQ2模型在 JPEG 压缩、噪声和对抗性攻击等多样化图像扰动下性能保持程度如何?
  • RQ3模型置信度分数在不同任务和分布偏移下校准程度如何?
  • RQ4在有限数据源上训练的模型是否仍能在新概念和新数据源上实现强大的零样本迁移性能?
  • RQ5不同模型架构和大小在多种视觉任务中的鲁棒性和泛化能力方面如何比较?

主要发现

  • 所有模型在图像扰动下均出现性能下降,仅零样本 GPV-1 在指代表达任务中因基线性能较低而例外。
  • GPV-2 在 GRIT 消融集上取得最高总体准确率(31.9%),在 Restricted 赛道中优于 Mask R-CNN(20.2%)和 Bae 等人(7.1%)。
  • 模型在新数据源和新概念上表现出显著性能下降,凸显了零样本泛化的局限性。
  • 校准指标揭示了权衡:最大化自我意识的模型往往具有更差的 RMSE,表明需在置信度可靠性与校准性之间取得平衡。
  • Restricted 赛道成功实现了对计算资源有限模型的公平比较,因其将训练数据限制在相同公开来源。
  • 由于数据中缺乏概念标注,表面法线估计和人体关键点检测任务未报告新概念性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。