[论文解读] FastInst: A Simple Query-Based Model for Real-Time Instance Segmentation
FastInst 提出了一种基于查询的实例分割框架,在使用轻量化架构的情况下实现了实时推理(32.5 FPS),在 COCO test-dev 上达到 40.5 AP。它引入了实例激活引导查询、双路径更新策略以及真实标签掩码引导学习,减少了对重型像素解码器和多层 Transformer 的依赖,从而在低推理延迟下实现高精度。
Recent attention in instance segmentation has focused on query-based models. Despite being non-maximum suppression (NMS)-free and end-to-end, the superiority of these models on high-accuracy real-time benchmarks has not been well demonstrated. In this paper, we show the strong potential of query-based models on efficient instance segmentation algorithm designs. We present FastInst, a simple, effective query-based framework for real-time instance segmentation. FastInst can execute at a real-time speed (i.e., 32.5 FPS) while yielding an AP of more than 40 (i.e., 40.5 AP) on COCO test-dev without bells and whistles. Specifically, FastInst follows the meta-architecture of recently introduced Mask2Former. Its key designs include instance activation-guided queries, dual-path update strategy, and ground truth mask-guided learning, which enable us to use lighter pixel decoders, fewer Transformer decoder layers, while achieving better performance. The experiments show that FastInst outperforms most state-of-the-art real-time counterparts, including strong fully convolutional baselines, in both speed and accuracy. Code can be found at https://github.com/junjiehe96/FastInst .
研究动机与目标
- 通过展示基于查询的模型在高效架构设计中的潜力,填补高精度、实时实例分割的空白。
- 克服现有基于查询的模型效率低下且计算成本高的问题,这些模型通常需要大量 Transformer 解码器层和重型像素解码器。
- 在 COCO 基准上实现最先进(SOTA)的精度-速度性能,且无需依赖 NMS 或复杂后处理。
- 实现轻量化、端到端且无需 NMS 的实例分割,适用于机器人和自动驾驶等实际应用场景。
提出的方法
- 引入实例激活引导查询,从特征图中动态选择具有高语义潜力的像素嵌入作为初始查询,减少对大量查询优化的需求。
- 在 Transformer 解码器中实施双路径更新策略,交替更新查询特征和像素特征,增强特征表示并加速收敛。
- 通过在训练期间用基于固定二分图匹配的真实标签掩码替换标准掩码注意力,实现真实标签掩码引导学习,使每个查询能够关注完整的目标物体区域。
- 使用可学习的位置嵌入代替正弦位置编码,在不损失性能的前提下提升推理速度。
- 通过改进查询与特征之间的交互,减少对复杂模块(如 MSDeformAttn)的依赖,设计轻量化像素解码器。
- 优化查询数量及选择来源(如特征图尺度),在精度与速度之间取得平衡,其中 E4 特征图展现出良好的权衡。
实验结果
研究问题
- RQ1基于查询的实例分割模型是否能在不使用 NMS 或复杂后处理的情况下,实现实时推理速度(≥30 FPS)并保持 COCO 上的高 AP(>40)?
- RQ2如何改进查询初始化过程,以减少所需的 Transformer 解码器层数并加速收敛?
- RQ3双路径更新策略在多大程度上能降低对重型像素解码器的依赖,并提升基于查询模型的特征表示能力?
- RQ4真实标签掩码引导学习是否能通过在训练期间使注意力更有效地关注完整物体区域,从而提升掩码注意力性能?
- RQ5在实时实例分割中,查询类型(IA 引导 vs. 辅助)和特征图尺度的最优配置是什么,以实现精度与速度的最佳平衡?
主要发现
- FastInst 使用 ResNet-50 主干网络在 COCO test-dev 上实现 40.5 AP 和 32.5 FPS,创下无需额外优化的实时实例分割新 SOTA 记录。
- 在更快变体下,模型在 53.8 FPS 下达到 35.6 AP,表明其在单张 V100 GPU 上具备出色的精度-速度权衡能力。
- 仅使用 6 层 Transformer 解码器,FastInst 即实现 30.5 AP,表明性能在早期即趋于饱和,减少层数可显著提升推理速度。
- 结合二分图匹配与位置代价损失的实例激活引导查询,使查询分布更集中于前景物体,提升了定位精度与召回率。
- 仅添加 10 个 IA 引导查询即可达到 31.2 AP,表明即使少量动态查询也能实现强大性能。
- 将正弦位置编码替换为可学习位置编码后,推理速度提升且性能无损失,证实了在部署中具有显著的效率优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。