[论文解读] SG-Net: Spatial Granularity Network for One-Stage Video Instance Segmentation
SG-Net 提出了一种单阶段视频实例分割框架,通过动态将检测到的实例划分为子区域以实现空间粒度分割,从而提升掩码质量和推理效率。该方法采用无提议网络、端到端的架构,并在检测、分割和跟踪任务间进行联合优化。在 YouTube-VIS 上,SG-Net 实现了当前最优性能,相较于两阶段方法在准确率和速度上均有提升。
Video instance segmentation (VIS) is a new and critical task in computer vision. To date, top-performing VIS methods extend the two-stage Mask R-CNN by adding a tracking branch, leaving plenty of room for improvement. In contrast, we approach the VIS task from a new perspective and propose a one-stage spatial granularity network (SG-Net). Compared to the conventional two-stage methods, SG-Net demonstrates four advantages: 1) Our method has a one-stage compact architecture and each task head (detection, segmentation, and tracking) is crafted interdependently so they can effectively share features and enjoy the joint optimization; 2) Our mask prediction is dynamically performed on the sub-regions of each detected instance, leading to high-quality masks of fine granularity; 3) Each of our task predictions avoids using expensive proposal-based RoI features, resulting in much reduced runtime complexity per instance; 4) Our tracking head models objects centerness movements for tracking, which effectively enhances the tracking robustness to different object appearances. In evaluation, we present state-of-the-art comparisons on the YouTube-VIS dataset. Extensive experiments demonstrate that our compact one-stage method can achieve improved performance in both accuracy and inference speed. We hope our SG-Net could serve as a strong and flexible baseline for the VIS task. Our code will be available.
研究动机与目标
- 为解决两阶段视频实例分割方法的局限性,如冗余的提议生成和低分辨率掩码特征。
- 通过实现细粒度、动态的子区域分割,而非基于统一 RoI 的预测,来提升掩码质量。
- 通过消除基于提议的 RoI 操作并降低对预测数量的运行时依赖,提升推理效率。
- 通过与检测头自然集成的基于中心度的运动建模,增强跟踪的鲁棒性。
提出的方法
- SG-Net 使用单阶段、全卷积主干网络(受 FCOS 启发),在无区域提议网络的情况下,联合优化检测、分割和跟踪头。
- 它基于空间粒度,将每个检测到的边界框动态划分为子区域(最多 6×6 网格),从而实现在每个子区域上进行高分辨率掩码预测。
- 掩码头对每个子区域执行实例感知的动态预测,使用上采样至输入分辨率一半(缩放因子=4)的特征图,以保留边界细节。
- 提出了一种新型跟踪头,利用检测头中的物体中心度来建模时间运动,从而提升在外观变化和物体重叠等复杂情况下的鲁棒性。
- 通过在检测、分割和跟踪头之间引入实例感知连接,增强特征共享,实现端到端的联合优化。
- 基础掩码由 FPN 特征(P3–P5)生成,消融实验表明 P3–P5 在准确率与速度之间实现了最佳权衡。
实验结果
研究问题
- RQ1单阶段、无提议的架构是否能在视频实例分割中实现比两阶段方法更高的准确率和更快的速度?
- RQ2与基于统一 RoI 或固定网格的方法相比,动态子区域分割在提升掩码质量方面有何优势?
- RQ3基于中心度的跟踪在物体重叠或外观变化等挑战性场景下,能在多大程度上提升鲁棒性?
- RQ4在空间粒度分割中,子区域划分数量与推理效率之间的最优权衡是什么?
- RQ5特征分辨率和位置如何影响分割头中基础掩码生成的性能?
主要发现
- SG-Net 在 YouTube-VIS 2019 上达到 36.3% AP,优于 MaskTrack R-CNN 及其他两阶段基线方法,且推理速度更快。
- 将子区域划分从 2× 增加到 6×,使 AP 从 34.0% 提升至 36.3%;但进一步增至 8× 仅带来微小增益(36.4%),且显著增加运行时间。
- 将基础掩码特征上采样至 1/2 输入分辨率(缩放因子=4),使 AP 提升 1.4%(从 34.9% 提升至 36.3%),AP@0.75 提升 1.5%(从 38.1% 提升至 39.6%)。
- 使用更深的 FPN 特征(P3–P5)生成基础掩码,使 AP 提升至 36.3%,AP@0.75 提升至 39.6%;而仅使用 P3 时,AP 和 AP@0.75 分别为 35.0% 和 37.0%。
- SG-Net 的推理时间随预测数量增加仅略有上升,而两阶段方法的运行时间则随提议数量线性增长。
- 在 COCO 图像基准上,SG-Net 的准确率优于 SipMask 和 CondInst,分别领先 1.3–1.8% 和 0.8–1.3%,且在相同主干网络设置下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。