[论文解读] Sparse Instance Activation for Real-Time Instance Segmentation
本文提出SparseInst,一种新颖的实时实例分割框架,通过稀疏实例激活图(IAMs)突出显示判别性物体区域,而非依赖边界框或密集中心。通过利用二分图匹配实现端到端训练并避免非极大值抑制(NMS),SparseInst在COCO数据集上实现40 FPS的推理速度与37.9的掩码AP,优于以往方法在速度与准确率上的表现。
In this paper, we propose a conceptually novel, efficient, and fully convolutional framework for real-time instance segmentation. Previously, most instance segmentation methods heavily rely on object detection and perform mask prediction based on bounding boxes or dense centers. In contrast, we propose a sparse set of instance activation maps, as a new object representation, to highlight informative regions for each foreground object. Then instance-level features are obtained by aggregating features according to the highlighted regions for recognition and segmentation. Moreover, based on bipartite matching, the instance activation maps can predict objects in a one-to-one style, thus avoiding non-maximum suppression (NMS) in post-processing. Owing to the simple yet effective designs with instance activation maps, SparseInst has extremely fast inference speed and achieves 40 FPS and 37.9 AP on the COCO benchmark, which significantly outperforms the counterparts in terms of speed and accuracy. Code and models are available at https://github.com/hustvl/SparseInst.
研究动机与目标
- 解决现有实时实例分割方法依赖密集预测与后处理所导致的效率低下与高延迟问题。
- 开发一种完全卷积、端到端的框架,避免使用非极大值抑制(NMS),并减少计算开销。
- 通过使用稀疏激活图突出显示信息丰富、与实例相关的区域,而非基于区域或中心的表示,提升特征聚合效果。
- 为自动驾驶与机器人等实时应用实现更优的速度-准确率权衡。
提出的方法
- 提出实例激活图(IAMs)作为新型目标表示,用于在特征空间中突出显示判别性、与实例相关的区域。
- 使用$3\times3$卷积层从特征图生成IAMs,实现局部上下文感知与空间定位。
- 通过匈牙利算法实施二分图匹配,将真实标注实例分配给预测结果,实现无需NMS的端到端学习。
- 采用单级特征预测头以降低计算成本与延迟。
- 设计完全卷积的解码器,直接从IAMs生成实例特征与分割掩码,避免使用RoI-Align或基于区域的操作。
- 引入轻量级后处理流程,消除排序与NMS操作,显著降低推理时间。
实验结果
研究问题
- RQ1稀疏、与实例相关的激活图表示是否能在实时实例分割中超越密集中心或基于区域的表示?
- RQ2如何在不依赖锚点或中心等手工设计空间先验的情况下,有效实现IAMs的端到端训练?
- RQ3是否可利用二分图匹配训练IAMs,使其抑制冗余预测并消除对NMS的需求?
- RQ4相较于$1\times1$卷积或基于查询的注意力机制,使用$3\times3$卷积生成IAMs在特征质量方面提升程度如何?
- RQ5与多级、检测器驱动的方法相比,采用IAMs的单级、完全卷积框架在速度-准确率权衡方面表现如何?
主要发现
- SparseInst在单张NVIDIA 2080Ti GPU上实现40.0 FPS的推理速度,COCO测试开发集上达到37.9的掩码AP,显著优于以往实时方法在速度与准确率上的表现。
- 在$448\times448$输入分辨率下,SparseInst达到58.5 FPS,同时保持优异的准确率,展现出在小尺寸输入下的高效性。
- 通过二分图匹配实现标签分配,使模型能够端到端训练且无需NMS,将后处理时间减少近10%的总推理时间。
- 可视化结果表明,IAMs在不同尺度、遮挡与姿态下均能一致地突出显示判别性物体部分,实现鲁棒的实例定位。
- 将IAMs替换为4头交叉注意力或100个查询时,mAP下降0.2至0.9,证实了基于$3\times3$卷积的IAM设计具有显著优势。
- 该方法在密集场景中泛化能力出色,即使在高实例密度下也能生成边界精细的精确分割掩码。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。