Skip to main content
QUICK REVIEW

[论文解读] Video K-Net: A Simple, Strong, and Unified Baseline for Video Segmentation

Xiangtai Li, Wenwei Zhang|arXiv (Cornell University)|Apr 10, 2022
Visual Attention and Saliency Detection被引用 4
一句话总结

Video K-Net 通过利用 K-Net 中的可学习卷积核,提出了一种简单、统一且端到端的视频全景分割框架,联合执行实例分割与跟踪。它引入了基于卷积核的外观建模以及带有对比损失的跨时序卷积核交互,以实现时序关联,在 Cityscapes-VPS、KITTI-STEP 和 VIPSeg 上实现了最先进性能,在 KITTI-STEP 上相对提升达 12%,在 VIPSeg 上达 15%。

ABSTRACT

This paper presents Video K-Net, a simple, strong, and unified framework for fully end-to-end video panoptic segmentation. The method is built upon K-Net, a method that unifies image segmentation via a group of learnable kernels. We observe that these learnable kernels from K-Net, which encode object appearances and contexts, can naturally associate identical instances across video frames. Motivated by this observation, Video K-Net learns to simultaneously segment and track "things" and "stuff" in a video with simple kernel-based appearance modeling and cross-temporal kernel interaction. Despite the simplicity, it achieves state-of-the-art video panoptic segmentation results on Citscapes-VPS, KITTI-STEP, and VIPSeg without bells and whistles. In particular, on KITTI-STEP, the simple method can boost almost 12\% relative improvements over previous methods. On VIPSeg, Video K-Net boosts almost 15\% relative improvements and results in 39.8 % VPQ. We also validate its generalization on video semantic segmentation, where we boost various baselines by 2\% on the VSPW dataset. Moreover, we extend K-Net into clip-level video framework for video instance segmentation, where we obtain 40.5% mAP for ResNet50 backbone and 54.1% mAP for Swin-base on YouTube-2019 validation set. We hope this simple, yet effective method can serve as a new, flexible baseline in unified video segmentation design. Both code and models are released at https://github.com/lxtGH/Video-K-Net.

研究动机与目标

  • 简化现有视频全景分割方法中依赖独立模块进行分割与跟踪的复杂流程。
  • 在单一框架中统一‘事物’与‘东西’的分割,并实现端到端的实例级跟踪。
  • 降低计算开销,消除对 RoI 头或跟踪查询等辅助组件的需求。
  • 通过卷积核层面的融合与关联,提升视频分割的时序一致性。
  • 建立一个强大、简洁且可泛化的统一视频分割基线。

提出的方法

  • 利用 K-Net 中的可学习卷积核作为视频帧间外观与上下文编码的内在表征。
  • 引入卷积核关联头及对比学习损失,生成用于时序跟踪的判别性嵌入。
  • 应用时序卷积核融合模块,在卷积核层面融合相邻帧的卷积核,避免昂贵的特征级注意力或级联模块。
  • 在训练过程中使用匈牙利匹配将卷积核与真实掩码配对,确保鲁棒性并减少未匹配样本带来的噪声。
  • 通过基于学习嵌入的卷积核跨帧关联实现在线跟踪,无需单独的跟踪查询或后处理 NMS。
  • 通过在关键帧与参考帧上联合训练,提升卷积核分组与分离效果,实现一致的分割与跟踪。

实验结果

研究问题

  • RQ1来自图像分割模型(如 K-Net)的可学习卷积核是否能自然支持端到端的视频实例跟踪,而无需额外的跟踪头或查询?
  • RQ2在视频全景分割中,与特征级融合相比,卷积核级时序融合在准确率与效率方面表现如何?
  • RQ3训练策略——特别是联合使用关键帧与参考帧——对卷积核关联与分割性能有何影响?
  • RQ4所提出的基于卷积核的关联方法与基于 RoI 或基于查询的跟踪方法相比,在准确率与计算成本方面表现如何?
  • RQ5统一的基于卷积核的框架在不同视频分割任务(包括语义与实例分割)上的泛化能力如何?

主要发现

  • Video K-Net 在 KITTI-STEP 上实现了 12% 的相对提升,显著优于以往方法,且流程更简洁。
  • 在 VIPSeg 上,该方法达到 39.8% 的 VPQ,较之前结果相对提升近 15%。
  • 在 KITTI-STEP 上,该框架在 STQ 上比基线 K-Net 提升 3.5%,同时仅增加 2.3% GFLOPs 和 1.8% 参数。
  • 在 VSPW 视频语义分割任务上,Video K-Net 使多种基线模型的 mIoU 提升 2%,展现出强大的泛化能力。
  • 在 YouTube-2019 视频实例分割基准上,使用 ResNet-50 时达到 40.5% mAP,使用 Swin-Base 时达到 54.1%,在大规模基准上表现强劲。
  • 消融实验表明,在最终阶段关联卷积核并使用匹配的卷积核样本进行训练可获得最佳结果,而早期融合会降低性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。