Skip to main content
QUICK REVIEW

[论文解读] Measuring Dataset Granularity

Yin Cui, Zeqi Gu|arXiv (Cornell University)|Dec 21, 2019
Anomaly Detection Techniques and Applications参考文献 48被引用 7
一句话总结

本文提出了一种基于聚类理论的连续、公理化框架,用于衡量数据集粒度,将其定义为标记数据和距离函数的函数。该文引入并验证了BH G和C指数等度量,这些度量满足一致性、不变性和尺度不变性,揭示出广泛认为是细粒度的数据集(如CUB-200)实际上包含与标准粗粒度数据集(如CIFAR-10)更相似的粗粒度子集。

ABSTRACT

Despite the increasing visibility of fine-grained recognition in our field, "fine-grained'' has thus far lacked a precise definition. In this work, building upon clustering theory, we pursue a framework for measuring dataset granularity. We argue that dataset granularity should depend not only on the data samples and their labels, but also on the distance function we choose. We propose an axiomatic framework to capture desired properties for a dataset granularity measure and provide examples of measures that satisfy these properties. We assess each measure via experiments on datasets with hierarchical labels of varying granularity. When measuring granularity in commonly used datasets with our measure, we find that certain datasets that are widely considered fine-grained in fact contain subsets of considerable size that are substantially more coarse-grained than datasets generally regarded as coarse-grained. We also investigate the interplay between dataset granularity with a variety of factors and find that fine-grained datasets are more difficult to learn from, more difficult to transfer to, more difficult to perform few-shot learning with, and more vulnerable to adversarial attacks.

研究动机与目标

  • 为视觉识别数据集中'细粒度'这一概念提供一个精确、定量的定义。
  • 将数据集粒度形式化为一种连续度量,依赖于标签和距离函数。
  • 建立一组公理化属性——粒度一致性、同构不变性和尺度不变性——以规定有效粒度度量应满足的条件。
  • 通过分层数据集对候选度量进行实证评估,并检验其在不同深度神经网络特征下的鲁棒性。
  • 研究数据集粒度对下游学习任务(如迁移学习、少样本学习和对抗鲁棒性)的影响。

提出的方法

  • 提出一个包含三个核心属性的公理化框架:粒度一致性(合并类别会增加粒度)、同构不变性(标签排列不影响度量)和尺度不变性(缩放距离不会改变度量)。
  • 引入两种候选度量:BHG(基于类内与类间距离比值)和C指数(一种适应于粒度的聚类质量度量)。
  • 采用分层标签结构作为真实标签的参考:将从属类别合并为超类别应严格增加粒度得分。
  • 使用ImageNet上预训练的ResNet-50特征作为距离函数,并在多种架构上测试其鲁棒性。
  • 将该度量应用于CUB-200、CIFAR-10等基准数据集,以比较不同数据集的相对粒度水平。
  • 通过受控实验验证度量结果,其中模拟了类别合并,确认其符合公理化属性。

实验结果

研究问题

  • RQ1能否定义一种连续的、数学基础坚实的粒度度量,以捕捉细粒度与粗粒度分类的直观概念?
  • RQ2距离函数的选择(如特征提取器和度量)如何影响数据集的测量粒度?
  • RQ3所提出的粒度度量在不同模型架构和数据集类型下是否具有鲁棒性?
  • RQ4数据集粒度与下游学习任务(如迁移学习和少样本学习)的难度之间是否存在相关性?
  • RQ5与粗粒度数据集相比,细粒度数据集在多大程度上更容易受到对抗攻击?

主要发现

  • 所提出的粒度度量表明,广泛认为是细粒度的数据集(如CUB-200)的子集可能显著比标准粗粒度数据集(如CIFAR-10)更粗粒度。
  • CIFAR-10常被视为粗粒度,但其粒度实际上比从CUB-200中提取的粗粒度子集(CUB-200-Sweet)更细。
  • 在不同距离函数和模型架构下,数据集粒度的相对排序保持稳定,表明该度量具有鲁棒性。
  • 细粒度数据集在学习上始终更具挑战性,迁移更困难,对少样本学习更具挑战性,且对对抗攻击更敏感。
  • BHG和C指数度量均满足全部三项公理化属性:粒度一致性、同构不变性和尺度不变性。
  • 通过证明:任何减少类内距离并增加类间距离的变换都会严格增加C指数值,从而证明C指数具有粒度一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。