[论文解读] Learning to Count Anything: Reference-less Class-agnostic Counting with Weak Supervision
本文提出RCC,一种无需参考图像、类别无关的计数方法,利用自监督视觉Transformer特征在无点级标注或参考图像的情况下对实例进行计数。该方法在FSC-147和改进后的FSC-133数据集上达到最先进性能,优于现有无需参考图像的方法,并与使用全监督的模型表现相当。
Current class-agnostic counting methods can generalise to unseen classes but usually require reference images to define the type of object to be counted, as well as instance annotations during training. Reference-less class-agnostic counting is an emerging field that identifies counting as, at its core, a repetition-recognition task. Such methods facilitate counting on a changing set composition. We show that a general feature space with global context can enumerate instances in an image without a prior on the object type present. Specifically, we demonstrate that regression from vision transformer features without point-level supervision or reference images is superior to other reference-less methods and is competitive with methods that use reference images. We show this on the current standard few-shot counting dataset FSC-147. We also propose an improved dataset, FSC-133, which removes errors, ambiguities, and repeated images from FSC-147 and demonstrate similar performance on it. To the best of our knowledge, we are the first weakly-supervised reference-less class-agnostic counting method.
研究动机与目标
- 开发一种无需参考图像或实例级标注即可泛化到未见物体类别的计数方法。
- 探究自监督视觉Transformer特征结合全局上下文是否可通过简单回归实现准确的、类别无关的计数。
- 通过创建清理后的、无错误的基准FSC-133,解决现有数据集的局限性,以实现对计数模型更可靠的评估。
- 证明自注意力机制的全局上下文对于以物体无关方式识别重复实例至关重要。
- 表明仅使用总数量监督(最小监督)结合强大且通用的特征,即可实现高精度计数。
提出的方法
- 该方法使用经过自监督预训练的视觉Transformer主干网络(ViT-Small),从输入图像中提取全局上下文感知特征。
- 通过一个简单的线性投影头,直接从视觉Transformer特征的展平分类令牌回归总数量。
- 模型仅使用真实标签计数作为监督信号进行训练,无需实例级标注或参考图像。
- 特征可视化结果表明,注意力机制在无位置监督的情况下也能定位相关物体区域。
- 该方法在FSC-147和新提出的FSC-133数据集上进行评估,后者修正了原始数据集中存在的错误、模糊性和重复图像问题。
- 消融实验对比了视觉Transformer与无自注意力机制的ResNet-50和ConvNeXt主干网络,证明了全局上下文的重要性。
实验结果
研究问题
- RQ1经过自监督预训练的视觉Transformer是否能够在无参考图像或点级标注的情况下实现准确的、类别无关的计数?
- RQ2自注意力机制的全局感受野是否在无需参考图像的设定下对识别重复实例至关重要?
- RQ3在计数任务中,视觉Transformer特征上的简单线性头是否优于更复杂的回归头?
- RQ4所提出方法的性能是否与使用全监督和参考图像的方法相当或更优?
- RQ5在真实世界场景中,该模型在多样化物体组合和未见类别上的泛化能力如何?
主要发现
- 在FSC-133上,RCC的测试集MAE为14.23,RMSE为43.83,优于唯一其他无需参考图像的方法,并与使用参考图像和全监督的最先进方法表现相当。
- 与ResNet-50和ConvNeXt相比,基于视觉Transformer的方法性能显著更优,即使在ImageNet预训练下也如此,证明了自注意力和全局上下文的重要性。
- 简单的线性回归头优于更复杂的卷积回归头,后者在训练类别上过拟合并导致性能下降。
- 特征可视化显示,模型在无任何位置监督的情况下隐式定位了相关物体实例,表明其具有强大的重复检测归纳偏差。
- 该模型在未见类别和物体组合上泛化良好,包括在跨域CARPK数据集上的表现,证明了其鲁棒性和可迁移性。
- 所提出的FSC-133数据集从FSC-147中移除了122个错误、15张模糊图像和12张重复图像,为未来研究提供了更清洁、更可靠的基准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。