Skip to main content
QUICK REVIEW

[论文解读] Pix2seq: A Language Modeling Framework for Object Detection

Ting Chen, Saurabh Saxena|arXiv (Cornell University)|Sep 22, 2021
Multimodal Machine Learning Applications参考文献 58被引用 128
一句话总结

Pix2Seq 将目标检测重新表述为一个语言建模任务,它生成表示边界框和类别标签的离散标记序列作为图像输入;在简单、通用架构下实现了与 COCO 相竞争的结果。

ABSTRACT

We present Pix2Seq, a simple and generic framework for object detection. Unlike existing approaches that explicitly integrate prior knowledge about the task, we cast object detection as a language modeling task conditioned on the observed pixel inputs. Object descriptions (e.g., bounding boxes and class labels) are expressed as sequences of discrete tokens, and we train a neural network to perceive the image and generate the desired sequence. Our approach is based mainly on the intuition that if a neural network knows about where and what the objects are, we just need to teach it how to read them out. Beyond the use of task-specific data augmentations, our approach makes minimal assumptions about the task, yet it achieves competitive results on the challenging COCO dataset, compared to highly specialized and well optimized detection algorithms.

研究动机与目标

  • 激发一种通用的、对任务无关的目标检测方法,尽量减少手工设计的架构和损失设计。
  • 将对象描述(边界框和类别标签)表示为离散标记的序列。
  • 证明通过最大似然训练的编码器–解码器模型可以在没有任务特定先验的情况下从像素输入中检测到对象。
  • 表明序列增强和基于标记的量化在 COCO 上实现具有竞争力的性能,并且在更大数据集上的预训练带来好处。

提出的方法

  • 将边界框量化为五令牌序列 [y_min, x_min, y_max, x_max, c],使用带有箱单位的共享词汇表加上类别令牌。
  • 将多个对象描述序列化为一个单一序列,采用对象的随机顺序并使用 EOS token。
  • 使用编码器(图像感知)+ Transformer 解码器自回归地生成标记并最大化标记似然性。
  • 在条件于图像与前序标记的标记上使用简单的 softmax 交叉熵损失进行训练(最大似然)。
  • 通过向输入序列中注入合成噪声对象并在目标中将其标注为噪声来进行序列增强,以提高召回率和鲁棒性。
  • 在推理期间,采样标记(例如 nucleus sampling)直到产生 EOS;从生成的标记序列中提取并对边界框和标签进行去量化。

实验结果

研究问题

  • RQ1目标检测是否可以有效地被表述为一个以图像输入为条件的语言建模问题?
  • RQ2在没有任务特定的对象提议或损失的情况下,使用带有标记化边界框和类别表示的通用编码器–解码器是否能取得具有竞争力的 COCO 结果?
  • RQ3序列增强和对象顺序随机性对检测召回率与精度的影响是什么?
  • RQ4在更大规模的检测数据集上的预训练如何影响在 COCO 上的性能?
  • RQ5在边界框使用基于标记的量化时,在精度和模型容量方面有哪些权衡?

主要发现

  • Pix2Seq 在 COCO 上对比 Faster R-CNN 和 DETR,在多种骨干网络和设置下取得具有竞争力的结果。
  • 在 ResNet-50 下,Pix2Seq 获得 AP 43.0 和 AP75 45.6,在某些指标上超过了一些基线;在 ResNet-101 下,观察到 AP 44.5 和 AP75 47.5。
  • 在 Objects365 上的预训练随后在 COCO 上微调可带来显著提升,例如 ViT-L 在微调阶段达到 AP 50.0,1333x1333(在列出的微调配置中最好)。
  • 使用 500+ 个桶进行量化提供高精度的边界框(在 640 的最长边下每个桶 1.3 像素),且在训练中随机对象顺序相较于确定性顺序可提升 AP 和 AR,且没有显著损失。
  • 序列增强显著提升召回率(在微调时尤为明显),对 AP 的影响适中或较小;通过似然偏移来延迟 EOS 有助于提高召回。
  • 在推理策略中,nucleus sampling 相比 argmax 能提高召回率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。