Skip to main content
QUICK REVIEW

[论文解读] Learning Video Instance Segmentation with Recurrent Graph Neural Networks

Joakim Johnander, Emil Brissman|arXiv (Cornell University)|Dec 7, 2020
Advanced Image and Video Retrieval Techniques参考文献 28被引用 7
一句话总结

本文提出了一种基于循环图神经网络(GNN)的新型端到端学习范式,用于视频实例分割,该范式联合建模检测分配、轨迹管理与外观建模。该方法实现了30 FPS的推理速度,并在YouTubeVIS上相比先前的实时方法mAP提升9.2%,在处理遮挡、误报和外观变化方面表现出更优的准确性和鲁棒性。

ABSTRACT

Most existing approaches to video instance segmentation comprise multiple modules that are heuristically combined to produce the final output. Formulating a purely learning-based method instead, which models both the temporal aspect as well as a generic track management required to solve the video instance segmentation task, is a highly challenging problem. In this work, we propose a novel learning formulation, where the entire video instance segmentation problem is modelled jointly. We fit a flexible model to our formulation that, with the help of a graph neural network, processes all available new information in each frame. Past information is considered and processed via a recurrent connection. We demonstrate the effectiveness of the proposed approach in comprehensive experiments. Our approach, operating at over 25 FPS, outperforms previous video real-time methods. We further conduct detailed ablative experiments that validate the different aspects of our approach.

研究动机与目标

  • 为解决模块化、基于启发式规则的流水线在视频实例分割中的局限性,将任务建模为联合学习问题。
  • 实现端到端训练,使其紧密模拟推理过程,包括时间建模和全局轨迹管理。
  • 通过统一的、可微分的框架提升对检测错误、遮挡和外观变化的鲁棒性。
  • 在不牺牲准确性的前提下实现实时性能(超过25 FPS),尤其在复杂视频序列中表现优异。

提出的方法

  • 该模型使用图神经网络(GNN)处理每帧中的所有检测结果和轨迹,计算检测结果与现有轨迹之间的成对匹配概率。
  • 循环连接机制在帧间保留并更新轨迹嵌入,实现时间建模和状态持久化。
  • 轨迹嵌入用于预测置信度、类别归属,以及通过可学习更新规则建模为高斯分布的外观特征。
  • 网络联合预测:(1) 检测结果是否应初始化新轨迹,(2) 检测-轨迹关联的概率,(3) 轨迹级别的置信度和类别。
  • 通过结合掩码IoU、类别Kronecker delta和检测置信度的可微分损失函数,实现端到端训练。
  • 引入可学习的外观建模组件,通过可微分的高斯分布更新轨迹嵌入,提升对外观变化的鲁棒性。

实验结果

研究问题

  • RQ1统一的、端到端可微分框架是否能在视频实例分割中超越模块化、基于启发式规则的流水线?
  • RQ2循环GNN架构在建模长期轨迹一致性和时间依赖性方面效果如何?
  • RQ3可学习的外观建模在多大程度上提升了对遮挡和外观变化的鲁棒性?
  • RQ4该模型是否能在复杂视频序列中保持高精度的同时实现实时运行(≥25 FPS)?

主要发现

  • 所提方法实现了30 FPS的推理速度,在YouTubeVIS上优于所有先前的实时方法,相比DeepSORT mAP绝对提升9.2%,相比MaskTrack R-CNN提升5.0%。
  • 消融实验表明,若移除外观建模或使用固定协方差,mAP将下降6.1个百分点,凸显其关键作用。
  • 若移除LSTM-like门控机制,训练将出现不稳定并发散,表明其对稳定优化至关重要。
  • 将ResNet50主干网络替换为ResNet101可显著提升性能,证实更强的特征提取能力有益,但会增加推理时间。
  • 定性结果表明,该模型能有效处理检测失败,抑制误报,并在遮挡期间维持轨迹稳定。
  • 失败案例包括对非标注类别(如企鹅)的跟踪错误,以及将图像中的人物(如照片)误识别为真实对象,表明其在非物理对象泛化方面仍存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。