[论文解读] Learning Video Instance Segmentation with Recurrent Graph Neural Networks
本文提出了一种基于循环图神经网络(GNN)的新型端到端学习范式,用于视频实例分割,该范式联合建模检测分配、轨迹管理与外观建模。该方法实现了30 FPS的推理速度,并在YouTubeVIS上相比先前的实时方法mAP提升9.2%,在处理遮挡、误报和外观变化方面表现出更优的准确性和鲁棒性。
Most existing approaches to video instance segmentation comprise multiple modules that are heuristically combined to produce the final output. Formulating a purely learning-based method instead, which models both the temporal aspect as well as a generic track management required to solve the video instance segmentation task, is a highly challenging problem. In this work, we propose a novel learning formulation, where the entire video instance segmentation problem is modelled jointly. We fit a flexible model to our formulation that, with the help of a graph neural network, processes all available new information in each frame. Past information is considered and processed via a recurrent connection. We demonstrate the effectiveness of the proposed approach in comprehensive experiments. Our approach, operating at over 25 FPS, outperforms previous video real-time methods. We further conduct detailed ablative experiments that validate the different aspects of our approach.
研究动机与目标
- 为解决模块化、基于启发式规则的流水线在视频实例分割中的局限性,将任务建模为联合学习问题。
- 实现端到端训练,使其紧密模拟推理过程,包括时间建模和全局轨迹管理。
- 通过统一的、可微分的框架提升对检测错误、遮挡和外观变化的鲁棒性。
- 在不牺牲准确性的前提下实现实时性能(超过25 FPS),尤其在复杂视频序列中表现优异。
提出的方法
- 该模型使用图神经网络(GNN)处理每帧中的所有检测结果和轨迹,计算检测结果与现有轨迹之间的成对匹配概率。
- 循环连接机制在帧间保留并更新轨迹嵌入,实现时间建模和状态持久化。
- 轨迹嵌入用于预测置信度、类别归属,以及通过可学习更新规则建模为高斯分布的外观特征。
- 网络联合预测:(1) 检测结果是否应初始化新轨迹,(2) 检测-轨迹关联的概率,(3) 轨迹级别的置信度和类别。
- 通过结合掩码IoU、类别Kronecker delta和检测置信度的可微分损失函数,实现端到端训练。
- 引入可学习的外观建模组件,通过可微分的高斯分布更新轨迹嵌入,提升对外观变化的鲁棒性。
实验结果
研究问题
- RQ1统一的、端到端可微分框架是否能在视频实例分割中超越模块化、基于启发式规则的流水线?
- RQ2循环GNN架构在建模长期轨迹一致性和时间依赖性方面效果如何?
- RQ3可学习的外观建模在多大程度上提升了对遮挡和外观变化的鲁棒性?
- RQ4该模型是否能在复杂视频序列中保持高精度的同时实现实时运行(≥25 FPS)?
主要发现
- 所提方法实现了30 FPS的推理速度,在YouTubeVIS上优于所有先前的实时方法,相比DeepSORT mAP绝对提升9.2%,相比MaskTrack R-CNN提升5.0%。
- 消融实验表明,若移除外观建模或使用固定协方差,mAP将下降6.1个百分点,凸显其关键作用。
- 若移除LSTM-like门控机制,训练将出现不稳定并发散,表明其对稳定优化至关重要。
- 将ResNet50主干网络替换为ResNet101可显著提升性能,证实更强的特征提取能力有益,但会增加推理时间。
- 定性结果表明,该模型能有效处理检测失败,抑制误报,并在遮挡期间维持轨迹稳定。
- 失败案例包括对非标注类别(如企鹅)的跟踪错误,以及将图像中的人物(如照片)误识别为真实对象,表明其在非物理对象泛化方面仍存在局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。