Skip to main content
QUICK REVIEW

[论文解读] Open-world Text-specified Object Counting

Niki Amini-Naieni, Kiana Amini-Naieni|arXiv (Cornell University)|Jun 2, 2023
Multimodal Machine Learning Applications被引用 6
一句话总结

本文提出CounTX,一种基于Transformer的单阶段、类别无关模型,用于开放世界文本指定对象计数任务,直接从图像和自然语言描述中预测对象数量,无需视觉样本。该方法在FSC-147基准上优于先前的两阶段方法,并引入了FSC-147-D,一个增强数据集,包含更详细的文本描述,以提升泛化能力。

ABSTRACT

Our objective is open-world object counting in images, where the target object class is specified by a text description. To this end, we propose CounTX, a class-agnostic, single-stage model using a transformer decoder counting head on top of pre-trained joint text-image representations. CounTX is able to count the number of instances of any class given only an image and a text description of the target object class, and can be trained end-to-end. In addition to this model, we make the following contributions: (i) we compare the performance of CounTX to prior work on open-world object counting, and show that our approach exceeds the state of the art on all measures on the FSC-147 benchmark for methods that use text to specify the task; (ii) we present and release FSC-147-D, an enhanced version of FSC-147 with text descriptions, so that object classes can be described with more detailed language than their simple class names. FSC-147-D and the code are available at https://www.robots.ox.ac.uk/~vgg/research/countx.

研究动机与目标

  • 解决目标类别未预先定义、必须在推理时指定的开放世界对象计数问题。
  • 通过仅使用文本描述,消除开放世界计数中对人工提供视觉样本(如边界框)的需求。
  • 开发一种单阶段、端到端可训练的模型,使其能够泛化到未见过的对象类别。
  • 通过添加详细的文本描述,增强FSC-147基准,以支持更复杂和真实的计数任务。
  • 评估在计数任务背景下,对图像编码器和文本编码器采用不同微调策略的有效性。

提出的方法

  • CounTX使用基于预训练CLIP的联合图像-文本编码器,将输入图像和文本描述嵌入到共享嵌入空间中。
  • 采用Transformer解码器计算文本嵌入与图像块特征之间的交叉注意力,通过建模相似性来定位相关对象区域。
  • 将得到的注意力图上采样至图像分辨率,并解码为密度图,用于预测总对象数量。
  • 通过在预测值与真实值的计数和密度图之间联合使用L1和L2损失,实现端到端训练。
  • 冻结文本编码器并微调图像编码器可获得最佳性能,该结论通过消融实验得到验证。
  • 该方法利用CLIP的零样本泛化能力,同时通过微调专门适应视觉编码器以提升计数性能。

实验结果

研究问题

  • RQ1单阶段、端到端模型是否能在无需视觉样本的情况下实现开放世界文本指定对象计数的最先进性能?
  • RQ2冻结或微调图像和文本编码器的选择如何影响计数性能?
  • RQ3基于预训练CLIP的模型在仅依赖自然语言描述的情况下,其泛化能力在多大程度上可实现对象计数?
  • RQ4在FSC-147基准中增加详细文本描述,是否能提升模型的泛化能力和评估鲁棒性?
  • RQ5模型是否能仅通过文本描述准确区分单张图像中的多个对象类别?

主要发现

  • CounTX在FSC-147测试集上达到15.88的平均绝对误差(MAE)和106.29的均方根误差(RMSE),在所有指标上均优于Xu等人(2023)的先前两阶段方法。
  • 冻结文本编码器并微调图像编码器可获得最佳性能,相比完全微调设置,MAE降低超过50%。
  • 该模型成功生成仅突出显示与给定文本描述匹配区域的密度图,证明其基于语义的精确定位能力。
  • 在FSC-147-D和CountBench上的定性结果表明,CounTX在实例数量较少和描述较复杂的图像上表现出良好的泛化能力。
  • FSC-147-D的发布,包含详细文本描述,使得对文本指定计数模型的评估更加真实和多样化。
  • 模型在推理时能泛化到未见过的对象类别,证实其具备开放世界能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。