Skip to main content
QUICK REVIEW

[论文解读] Low-Latency Video Semantic Segmentation

Yule Li, Jianping Shi|ArXiv.org|Apr 2, 2018
Visual Attention and Saliency Detection参考文献 25被引用 3
一句话总结

本文提出了一种基于空间可变卷积的自适应特征传播和自适应调度器的低延迟视频语义分割框架,用于关键帧选择。通过根据精度预测动态分配计算资源,并在帧间高效重用特征,该方法在Cityscapes数据集上的延迟降低至119ms,仅为基线的33%,同时实现了最先进的性能,精度和效率均得到提升。

ABSTRACT

Recent years have seen remarkable progress in semantic segmentation. Yet, it remains a challenging task to apply segmentation techniques to video-based applications. Specifically, the high throughput of video streams, the sheer cost of running fully convolutional networks, together with the low-latency requirements in many real-world applications, e.g. autonomous driving, present a significant challenge to the design of the video segmentation framework. To tackle this combined challenge, we develop a framework for video semantic segmentation, which incorporates two novel components: (1) a feature propagation module that adaptively fuses features over time via spatially variant convolution, thus reducing the cost of per-frame computation; and (2) an adaptive scheduler that dynamically allocate computation based on accuracy prediction. Both components work together to ensure low latency while maintaining high segmentation quality. On both Cityscapes and CamVid, the proposed framework obtained competitive performance compared to the state of the art, while substantially reducing the latency, from 360 ms to 119 ms.

研究动机与目标

  • 解决自动驾驶等实时应用中低延迟视频语义分割的挑战。
  • 克服现有方法仅降低平均成本但未降低最大延迟的局限性。
  • 通过空间自适应而非均匀的传播权重,提升帧间特征重用效率。
  • 设计一种动态关键帧调度机制,在不牺牲精度的前提下减少计算量。
  • 在推理延迟与分割精度之间实现优于先前方法的更好权衡。

提出的方法

  • 引入基于空间可变卷积的特征传播模块,利用位置相关的权重自适应融合前一帧的特征。
  • 采用自适应调度器,预测分割精度,并仅在必要时触发关键帧计算。
  • 使用双分支网络架构:下层用于快速推理,上层用于精确的特征提取。
  • 通过并行处理协调关键帧计算与特征传播,最大限度减少空闲时间。
  • 将自适应传播与调度模块集成到端到端可训练框架中,实现在线视频分割。
  • 利用中间特征图进行精度预测,以指导动态调度决策。

实验结果

研究问题

  • RQ1基于空间可变卷积的自适应特征传播是否能在降低计算量的同时提升视频流中的分割精度?
  • RQ2动态关键帧调度策略是否能在不降低性能的前提下减少最大延迟?
  • RQ3在基准数据集上,所提框架在延迟和mIoU方面与最先进方法相比如何?
  • RQ4自适应调度器在保持高精度的前提下,能将关键帧数量减少多少?
  • RQ5自适应传播与调度的结合是否能在复杂动态环境中实现实时性能?

主要发现

  • 所提框架在Cityscapes数据集上的推理延迟降低至119ms,相比360ms的基线降低了67%。
  • 在Cityscapes上,该方法实现了82.9%的平均交并比(mIoU),优于先前的最先进方法。
  • 在CamVid数据集上,该方法实现了94.6%的像素精度和82.9%的类别精度,均为对比方法中的最高值。
  • 自适应调度器在所有关键帧间隔下均优于固定频率和阈值调度策略,在计算受限条件下进一步提升了精度。
  • 延迟分析表明,自适应传播和调度模块分别仅占总延迟的10.5%和5.5%,表明其具有很高的效率。
  • 在Cityscapes和CamVid上的可视化结果表明,边界和纹理细节显著改善,尤其在动态或复杂场景中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。